Ett flaggskepp lämnar sin förhandsvisningsetikett
DeepSeek flyttade sin flaggskeppsmodell V4 Pro från förhandsvisning till allmän tillgänglighet den 12 augusti 2026, och avslutade därmed en testperiod som hade pågått sedan den 24 april. Versionen bär versionsetiketten 0813 och följer den mindre varianten V4-Flash, som tog samma steg till officiell status redan den 31 juli. Båda modellerna ligger nu i DeepSeeks produktions-API och inte längre i en förhandsvisningsnivå där utvecklare hade varnats för ändringar utan föregående meddelande.
V4 Pro behåller kontextfönstret på en miljon token som den redan hade i förhandsvisning, med en maximal utdata på 384 000 token per förfrågan. DeepSeek byggde modellen som ett mixture-of-experts-system med 1,6 biljoner parametrar totalt, varav 49 miljarder aktiveras för varje enskild token, samma arkitekturmönster som företaget har använt sedan V3 för att hålla driftskostnaderna nere samtidigt som den totala kapaciteten skalas upp.
Effektivitetskalkylen bakom 1,6 biljoner parametrar
Nyheten är inte antalet parametrar, utan hur billigt DeepSeek lyckas betjäna dem. En ny uppmärksamhetsmekanism som företaget kallar Compressed Sparse Attention, kombinerad med det den kallar Heavily Compressed Attention, sänker beräkningen per inferenstoken till 27 procent av vad den tidigare modellen V3.2 krävde, och krymper den minneskrävande key-value-cachen till 10 procent av det tidigare fotavtrycket.
På benchmarks löser V4 Pro 80,6 procent av uppgifterna i SWE-bench Verified, i nivå med Googles Gemini-3.1-Pro på samma test, och får en godkännandegrad på 90,1 procent på GPQA Diamond och 93,5 procent på LiveCodeBench. Den ligger efter OpenAIs GPT-5.4 på Terminal Bench 2.0, med 67,9 mot 75,1, och får ett Codeforces-betyg på 3 206, bevis på att DeepSeek nu mätts mot de ledande amerikanska laboratorierna, inte längre vid sidan av dem.
98 procent billigare, och inte länge till
Vid allmän tillgänglighet kostar V4 Pro 0,435 dollar per miljon inputtoken vid en cache miss, 0,003625 dollar per miljon vid en cache hit, och 0,87 dollar per miljon outputtoken, oförändrat från förhandsvisningen. Den billigare nivån V4-Flash kostar 0,14 dollar per miljon inputtoken och 0,28 dollar för output. Analysföretaget Artificial Analysis mätte den faktiska kostnaden för V4-Flash till cirka 0,03 dollar per referensuppgift, mot 1,86 dollar för OpenAIs GPT-5.6 Sol och 3,15 dollar för Anthropics Claude Fable 5, en skillnad på över 98 procent.
Under samma period som lanseringen av V4 Pro hade DeepSeeks utvecklardokumentation ett separat meddelande: det övergripande API-priset kommer att höjas betydligt inom en snar framtid, även om företaget inte angav datum eller procentsats. Utvecklare uppmanades att planera sin användning därefter, med den slutgiltiga prisstrukturen att tillkännages separat, ett ovanligt erkännande att dagens prislista inte är den som kunderna bör budgetera mot.
Kostnadsposten som just blev rörlig
Tidpunkten väger tyngre än siffran. DeepSeek varnar för en omprissättning i samma utgivningscykel som just gav V4 Pro produktionsstatus, vilket signalerar till inköpsteam att modellens tillförlitlighet mognade före dess kostnad. En gräns på 500 samtidiga förfrågningar på Pro-slutpunkten, en femtedel av taket på 2 500 på den billigare Flash-nivån, är en andra signal i samma riktning: kapaciteten på den dyrare, högre kvalitativa nivån är den begränsning DeepSeek hanterar först, och priset är den spak som återstår.
Företag som flyttade arbetsbelastningar mot kinesiska modeller specifikt för att undkomma oförutsägbara amerikanska priser bär nu samma exponering från andra hållet, utan golv och utan datum i kalendern. Enbart som illustration, inte en prognos: för ett stockholmskt särbolag inom företags-SaaS som budgeterar i kronor, skulle en ökning från cirka 9,1 till 15,8 svenska kronor per miljon outputtoken på en arbetsbelastning på flera miljarder token i månaden göra en avrundningsskillnad till en sexsiffrig årlig svängning, och DeepSeek har inte gett någon garanti för att ökningen stannar där. Att behandla en subventionerad prislista som en fast post i en flerårsbudget har alltid varit ett vad om att en nedsatt marknad skulle hålla sig stilla; leverantören har nu sagt, i sin egen dokumentation, att så inte blir fallet.
Läs vidare: Modellen byttes, API-namnet gjorde det inte | Pekings kontorstid styr nu din AI-räkning



