Et flagskib lægger sit previewmærke fra sig
DeepSeek flyttede sin flagskibsmodel V4 Pro fra preview til generel tilgængelighed den 12. august 2026, og afsluttede dermed en testperiode der havde kørt siden den 24. april. Bygget bærer versionsmærket 0813 og følger efter den mindre variant V4-Flash, som tog samme skridt til officiel status allerede den 31. juli. Begge modeller ligger nu i DeepSeeks produktions-API og ikke længere i et previewniveau, hvor udviklere var advaret om ændringer uden varsel.
V4 Pro beholder kontekstvinduet på en million tokens, som det havde i preview, med en maksimal output på 384.000 tokens pr. forespørgsel. DeepSeek byggede modellen som et mixture-of-experts-system med 1,6 billioner parametre i alt, hvoraf 49 milliarder aktiveres for hvert enkelt token, det samme arkitekturmønster virksomheden har brugt siden V3 for at holde driftsomkostningerne nede, mens den samlede kapacitet skaleres op.
Effektivitetsregnskabet bag 1,6 billioner parametre
Overskriften er ikke antallet af parametre, men hvor billigt DeepSeek formår at betjene dem. En ny opmærksomhedsmekanisme, virksomheden kalder Compressed Sparse Attention, kombineret med det den kalder Heavily Compressed Attention, sænker beregningen pr. inferenstoken til 27 procent af hvad den tidligere model V3.2 krævede, og formindsker den hukommelsestunge key-value-cache til 10 procent af det tidligere fodaftryk.
På benchmarks løser V4 Pro 80,6 procent af opgaverne i SWE-bench Verified, på niveau med Googles Gemini-3.1-Pro på samme test, og opnår en beståelsesprocent på 90,1 på GPQA Diamond og 93,5 på LiveCodeBench. Den ligger bagefter OpenAIs GPT-5.4 på Terminal Bench 2.0, med 67,9 mod 75,1, og opnår en Codeforces-vurdering på 3.206, bevis på at DeepSeek nu bliver målt op mod de førende amerikanske laboratorier, ikke længere ved siden af dem.
98 procent billigere, og ikke længe endnu
Ved generel tilgængelighed koster V4 Pro 0,435 dollar pr. million inputtokens ved et cache miss, 0,003625 dollar pr. million ved et cache hit, og 0,87 dollar pr. million outputtokens, uændret fra preview-prisen. Det billigere Flash-niveau koster 0,14 dollar pr. million inputtokens og 0,28 dollar for output. Analysehuset Artificial Analysis målte de faktiske omkostninger for V4-Flash til omkring 0,03 dollar pr. benchmarkopgave, mod 1,86 dollar for OpenAIs GPT-5.6 Sol og 3,15 dollar for Anthropics Claude Fable 5, en forskel på over 98 procent.
I samme periode som lanceringen af V4 Pro havde DeepSeeks udviklerdokumentation en separat meddelelse: den samlede API-pris vil stige betydeligt i nær fremtid, selvom virksomheden ikke oplyste dato eller procentsats. Udviklere blev bedt om at planlægge deres forbrug derefter, med den endelige prisstruktur til senere annoncering, en usædvanlig indrømmelse af at dagens prisliste ikke er den, kunderne bør budgettere efter.
Budgetposten der lige er blevet variabel
Timingen betyder mere end tallet. DeepSeek advarer om en genprissætning i samme udgivelsescyklus, der lige har givet V4 Pro produktionsstatus, hvilket fortæller indkøbsteams at modellens pålidelighed modnedes før dens omkostning. En grænse på 500 samtidige forespørgsler på Pro-endpointet, en femtedel af loftet på 2.500 på det billigere Flash-niveau, er et andet signal i samme retning: kapaciteten på det dyrere, højere kvalitetsniveau er den begrænsning DeepSeek styrer først, og prisen er den håndtag der er tilbage.
Virksomheder der flyttede arbejdsbyrder mod kinesiske modeller specifikt for at undgå uforudsigelige amerikanske priser bærer nu den samme eksponering fra den anden retning, uden bund og uden dato på kalenderen. Kun som eksempel, ikke en prognose: for en københavnsk offentlig it-afdeling der budgetterer i kroner, ville en stigning fra omkring 6 til 10,4 danske kroner pr. million outputtokens på en arbejdsbyrde på flere milliarder tokens om måneden gøre en afrundingsfejl til en syvcifret årlig udsving, og DeepSeek har ikke givet nogen garanti for at stigningen stopper der. At behandle en subsidieret prisliste som en fast post i et flerårigt budget har altid været et væddemål om at et nedsat marked ville holde stille; leverandøren har nu sagt, i sin egen dokumentation, at det ikke gør det.
Læs videre: Modellen skiftede, API-navnet gjorde det ikke | Beijings kontortid bestemmer nu din AI-regning



