Een nieuw getal op een oud model
Op 12 augustus 2026 presenteerde SpaceXAI, het bedrijf dat voor de fusie met SpaceX nog als xAI opereerde, Grok 4.6. De release notes bevatten een ongewone erkenning voor een lancering: het netwerk daaronder is hetzelfde V9-basismodel van 1,5 biljoen parameters dat al in Grok 4.5 zat. Er veranderde niets aan de architectuur, het aantal parameters of de pretrainingsrun. Wat wel veranderde, was alles wat er na die pretraining met het model gebeurde.
Dat onderscheid is belangrijk omdat labs een sprong in vermogen meestal anders uitleggen. Een nieuw modelnummer betekende doorgaans een nieuw basisnetwerk, vanaf nul getraind op een grotere of recentere dataset, tegen rekenkosten van tientallen miljoenen dollars. Grok 4.6 stak zijn budget in plaats daarvan in langdurige supervised fine-tuning en reinforcement learning, de fase na de training waarin een model goede en slechte antwoorden krijgt voorgelegd en wordt bijgestuurd om de goede te verkiezen, zonder de gewichten aan te raken die zijn ruwe kennis vastleggen.
Waar de cijfers uitkomen
Op de benchmarks die SpaceXAI koos te publiceren, haalt Grok 4.6 69,9 procent op CursorBench v3.2, een codeeragent-test gebouwd op echte Cursor-sessies, 65,9 procent op DeepSWE v1.1, 57,5 procent op APEX-Agents en 61,3 procent op FrontierCode v1.1. Het bedrijf presenteert elk van de vier cijfers als verbetering ten opzichte van Grok 4.5, maar publiceerde de cijfers van de vorige generatie op dezelfde tests niet ernaast, dus de omvang van de sprong blijft een claim van SpaceXAI die Servola niet zelfstandig kan narekenen.
De nuttigere externe toets komt van Artificial Analysis, een derde partij die een eigen Intelligence Index bijhoudt over leveranciers heen. Daar scoort Grok 4.6 61 punten, gelijk met GPT-5.6 Sol van OpenAI en voor het Chinese model Kimi K3, maar nog steeds achter Claude Opus 5 en Claude Fable 5 aan de top. Op GDPval-AA v2, een aparte index gebouwd op echt kenniswerk, haalt Grok 4.6 een Elo van 1.753. Samen genomen heeft het model het gat met de koplopers flink verkleind zonder ooit zijn eigen basisnetwerk te verlaten.
Prijs, context en waar het draait
De prijzen veranderen niet ten opzichte van wat een Grok 4.5-klant al betaalt onder 200.000 tokens context: 2 dollar per miljoen inputtokens, 0,50 dollar per miljoen gecachte inputtokens en 6 dollar per miljoen outputtokens. Boven 200.000 tokens stijgen de tarieven naar 4, 1 en 12 dollar, een drempel die de meeste agentische codeersessies zelden raken, maar die een documentzware juridische of onderzoeksworkflow vaak zou kunnen halen. VentureBeat's eigen berichtgeving noemt een contextvenster van 500.000 tokens; dat cijfer staat niet op SpaceXAI's eigen aankondigingspagina en moet dus als een cijfer uit tweede hand worden behandeld tot het bedrijf het zelf bevestigt.
De toegang is vanaf dag een breed: Cursor, Grok Build, de SpaceXAI-API, OpenRouter, Vercel en Cloudflare vermelden Grok 4.6 allemaal als direct beschikbaar, in plaats van het eerst in een besloten bèta te plaatsen. Voor een team dat al via een van die vijf kanalen werkt, is overstappen naar Grok 4.6 een regel in een configuratiebestand, geen nieuwe integratie.
Wat er echt speelt: als training het wint van schaal
Het echte nieuws is niet dat Grok 4.6 beter is dan Grok 4.5. Het is dat twee opeenvolgende releases nu op hetzelfde basisnetwerk draaien, en dat de tweede het grootste deel van het gat met GPT-5.6 Sol en Claude Fable 5 dichtte met alleen post-training. Dat is een veelzeggend gegeven over waar vooruitgang aan de top van AI op dit moment echt vandaan komt. Jarenlang was het dominante verhaal grotere clusters en grotere pretrainingsruns. Grok 4.6 laat zien dat een goed uitgevoerde ronde supervised fine-tuning en reinforcement learning inmiddels een vergelijkbaar deel van dat gat kan dichten, op hardware en een basismodel dat de leverancier al bezit.
Het gevolg voor wie de positie van leveranciers volgt, is dat een plek op de ranglijst geen betrouwbare graadmeter meer is voor hoeveel kapitaal of hoe groot een rekencluster achter een bedrijf staat. Een concurrent met een kleiner rekenbudget zou in principe een benchmarkgat op zijn eigen bestaande basismodel kunnen dichten, precies zoals SpaceXAI nu deed, zonder ooit een nieuw basismodel of een trainingsrun aan te kondigen die groot genoeg is voor het nieuws. De slotgracht die een groot pretrainingsbudget vroeger kocht, is ondieper geworden, en de tijd waarin een rivaal kan reageren, is korter geworden.
Wat dit betekent voor een leverancier waar u al op bouwt
Een ondernemer die kiest op welke AI-leverancier hij standaardiseert, moet de huidige benchmarkpositie behandelen als een momentopname met een korte houdbaarheid, niet als een blijvend voordeel dat met infrastructuur is gekocht. Omdat een post-trainingscyclus in weken verloopt en niet in de meer dan een jaar die een volledige hertraining vergt, kan het gat tussen twee leveranciers merkbaar verschuiven tussen de ene inkoopbeoordeling en de volgende, in beide richtingen, zonder dat een van beide bedrijven ook maar een nieuw basismodel aankondigt. Vraag een mogelijke leverancier hoe zijn laatste capaciteitssprong tot stand kwam; het antwoord voorspelt hoe snel een concurrent hem kan evenaren.
Het praktische antwoord is om integratievlakken leverancier-onafhankelijk te houden waar de taak dat toelaat, vaker opnieuw te benchmarken dan een typische post-trainingscyclus duurt in plaats van eenmaal per jaar, en te stoppen met de huidige prijs per token of ranglijstpositie van een leverancier als een permanente slotgracht te lezen. Grok 4.6 is het praktische bewijs dat precies het gat waarop een afhankelijkheidsbeslissing bij een leverancier soms steunt, kan worden gedicht zonder de kapitaaluitgave die die beslissing veronderstelde.
Lees hierna: Het verbod geldt, de zaak blijft open | Een gratis invoegtoepassing kan al uw documenten lezen



