Een vlaggenschip verliest zijn previewlabel
DeepSeek haalde zijn vlaggenschipmodel V4 Pro op 12 augustus 2026 uit de preview naar algemene beschikbaarheid, en sloot daarmee een testfase af die sinds 24 april liep. De build draagt de versietag 0813 en volgt op de kleinere variant V4-Flash, die dezelfde stap naar officiële status al op 31 juli zette. Beide modellen draaien nu in de productie-API van DeepSeek en niet meer in een previewlaag waar ontwikkelaars gewaarschuwd waren voor wijzigingen zonder aankondiging.
V4 Pro behoudt het contextvenster van een miljoen tokens dat het al in preview had, met een maximale output van 384.000 tokens per aanvraag. DeepSeek bouwde het model als een mixture-of-experts-systeem met 1,6 biljoen parameters in totaal, waarvan 49 miljard actief worden voor elk afzonderlijk token, hetzelfde architectuurpatroon dat het bedrijf sinds V3 gebruikt om de bedieningskosten laag te houden terwijl de totale capaciteit toeneemt.
De efficientieslag achter 1,6 biljoen parameters
Het echte nieuws is niet het aantal parameters, maar hoe goedkoop DeepSeek ze weet te bedienen. Een nieuw aandachtsmechanisme dat het bedrijf Compressed Sparse Attention noemt, gecombineerd met wat het Heavily Compressed Attention noemt, verlaagt de rekenkracht per inferentietoken naar 27 procent van wat het vorige model V3.2 nodig had, en verkleint de geheugenintensieve key-value-cache naar 10 procent van de eerdere omvang.
Op benchmarks lost V4 Pro 80,6 procent van de SWE-bench Verified-taken op, gelijk met Gemini-3.1-Pro van Google op dezelfde test, en haalt het een slagingspercentage van 90,1 procent op GPQA Diamond en 93,5 procent op LiveCodeBench. Het blijft achter bij GPT-5.4 van OpenAI op Terminal Bench 2.0, met 67,9 tegenover 75,1, en behaalt een Codeforces-score van 3.206, bewijs dat DeepSeek nu wordt afgemeten tegen de toonaangevende Amerikaanse labs, niet meer ernaast.
Achtennegentig procent goedkoper, en dat niet lang meer
Bij algemene beschikbaarheid kost V4 Pro 0,435 dollar per miljoen inputtokens bij een cache miss, 0,003625 dollar per miljoen bij een cache hit, en 0,87 dollar per miljoen outputtokens, ongewijzigd ten opzichte van de preview. De goedkopere laag V4-Flash kost 0,14 dollar per miljoen inputtokens en 0,28 dollar voor output. Onderzoeksbureau Artificial Analysis mat de effectieve kosten van V4-Flash op ongeveer 0,03 dollar per benchmarktaak, tegenover 1,86 dollar voor GPT-5.6 Sol van OpenAI en 3,15 dollar voor Claude Fable 5 van Anthropic, een verschil van meer dan 98 procent.
In dezelfde periode als de lancering van V4 Pro stond op de ontwikkelaarsdocumentatie van DeepSeek een apart bericht: de algehele API-prijs gaat in de nabije toekomst fors stijgen, al noemde het bedrijf geen datum en geen percentage. Ontwikkelaars werd gevraagd hun gebruik daarop aan te passen, met de definitieve prijsstructuur apart aangekondigd, een ongebruikelijke erkenning dat de huidige prijslijst niet degene is waarop klanten hun budget zouden moeten baseren.
De begrotingspost die net variabel is geworden
De timing telt zwaarder dan het getal. DeepSeek waarschuwt voor een herprijzing in dezelfde releasecyclus die V4 Pro net productiestatus gaf, wat inkoopteams vertelt dat de betrouwbaarheid van het model eerder volwassen werd dan de kosten. Een concurrency-limiet van 500 gelijktijdige verzoeken op het Pro-eindpunt, een vijfde van het plafond van 2.500 bij de goedkopere Flash-laag, is een tweede signaal in dezelfde richting: de capaciteit van de duurdere, kwalitatief betere laag is het knelpunt dat DeepSeek als eerste beheert, en de prijs is de hendel die het nog heeft.
Bedrijven die workloads specifiek naar Chinese modellen verplaatsten om te ontsnappen aan de onvoorspelbare Amerikaanse prijzen, dragen nu dezelfde blootstelling vanuit de andere richting, zonder ondergrens en zonder datum op de kalender. Alleen ter illustratie, geen voorspelling: voor een Rotterdams fintechbedrijf dat in euro's begroot, zou een stijging van ongeveer 0,80 naar 1,38 euro per miljoen outputtokens op een workload van enkele miljarden tokens per maand een afrondingsverschil in een zescijferige jaarlijkse schommeling veranderen, en DeepSeek heeft geen garantie gegeven dat de stijging daar stopt. Een gesubsidieerde prijslijst behandelen als een vaste post in een meerjarig budget was altijd een gok dat een afgeprijsde markt stil zou blijven staan; de leverancier heeft nu in zijn eigen documentatie gezegd dat dat niet gebeurt.
Lees hierna: Het model veranderde, de API-naam niet | Pekingse kantooruren bepalen nu uw AI-rekening



