Wat er gebeurde op de dag van de lancering
OpenAI was van plan de aankondiging van GPT-6 Astra op 3 september 2026 om 14.00 uur Eastern Time te publiceren. Het bericht ging online, werd verwijderd, verscheen als dode link toen OpenAI's eigen account het om 15.32 uur tweette, en werd pas betrouwbaar zichtbaar tussen ongeveer 16.20 en 17.20 uur, nadat Sam Altman de link al opnieuw had gedeeld.
Binnen die paar uur veranderden verschillende benchmarkcijfers in het bericht zelf, niet eenmalig maar in meerdere opeenvolgende momentopnamen, voordat sommige terugkeerden naar hun oorspronkelijke waarden.
De cijfers die bewogen, momentopname voor momentopname
Onafhankelijke monitoring van de opeenvolgende versies van de pagina, gemeld door Fortune, registreerde de volgende veranderingen:
| Meetwaarde | Vroeg gepubliceerd cijfer | Latere herziening | Huidige stand |
|---|---|---|---|
| Astra op ARC-AGI-3 | 98,6% (embargo-concept) | 99,99% (live blog) | 99,99% |
| Astra-hallucinatiepercentage | 4,2% (eerste momentopname) | 2% (zesde momentopname) | Teruggezet naar 4,2% |
| GPT-5.6 Sol-hallucinatiepercentage | 12,2% (eerste versie) | 9,4% (latere versie) | Teruggezet naar 12,2% |
| Claude Fable 5.1, FrontierMath Tier 4 | 87,8% (eerste versie) | 78%, daarna 83% | 83% |
Nog twee meetwaarden bewogen in hetzelfde tijdvenster: een ExploitBench-cyberveiligheidsscore voor GPT-5.6 Sol verschoof van 5,5 naar 11,5 procent voordat OpenAI zei een terugzetting te onderzoeken, en een codeerbenchmark voor Astra steeg van 57,7 naar 57,9 procent.
OpenAI's uitleg, en waarom die onderzoekers niet volledig overtuigde
OpenAI liet Fortune weten sterk te hechten aan correcte evaluaties, en dat de meeste evaluaties enkele procentpunten ruis vertonen afhankelijk van het exacte checkpoint, de scaffold en de gebruikte evaluatierun. Het bedrijf omschreef de wijzigingen als correcties bedoeld om de beste inschatting van de beschikbare modelprestaties weer te geven.
Anka Reuel en Mike Hardy van Stanfords Intelligent Systems Laboratory en Trustworthy AI Lab zeiden dat het patroon aanvoelt als benchmaxxen, het bijsturen naar een goed krantenkopcijfer, en wezen op onvoldoende technische transparantie over wat er precies veranderde en waarom. Vincent Sunn Chen van Snorkel AI was terughoudender en noemde de verschuivingen normale logistiek rond het einde van een lancering, maar riep toch op tot een sectornorm die vastlegt wat er tussen benchmarkherzieningen verandert en wanneer.
Waarom de cijfers van concurrenten meer tellen dan die van Astra zelf
Dat OpenAI de scores van het eigen model naar boven bijstelt, wekt een voor de hand liggend motief. Het meest veelzeggende detail is dat ook de cijfers van een rivaal bewogen, in beide richtingen, op dezelfde pagina, op dezelfde dag: de FrontierMath-score van Claude Fable 5.1 daalde negen punten en herstelde daarna deels, en de HealthBench Professional-scores van Claude Fable 5.1 en Opus 5 werden midden in de lancering naar boven bijgesteld voordat ze zich stabiliseerden.
Dat een leverancier de eigen claim corrigeert, is routine. Dat de lanceringspagina van een leverancier ook de plek is waar de publieke score van een concurrent meermaals wordt herzien voordat de sector de pagina heeft uitgelezen, is een ander soort gebeurtenis, en juist die maakt hiervan meer dan een PR-voetnoot: een due-diligencekwestie.
De beslissing die dit verandert: wat een benchmarkkaart waard is op het moment dat je hem leest
Elke zakelijke koper die deze week Astra's lanceringscijfers over ARC-AGI-3 of hallucinaties aanhaalde in een inkoopnotitie, citeerde in feite een cijfer dat al minstens één keer was veranderd en opnieuw kon veranderen. Er bestaat vandaag geen wettelijke verplichting voor een AI-lab om zijn eigen gepubliceerde evaluatieclaims te versiebeheren en dateren zoals bij een financiële deponering.
De praktische oplossing is goedkoop en nu al beschikbaar: leg de benchmarkpagina vast of archiveer haar op het moment dat je erop vertrouwt, noteer het exacte cijfer en tijdstip in het inkoopdocument, en behandel een vergelijkingstabel van de lanceringsdag als een claim die geverifieerd moet worden voordat een contract wordt getekend, niet als een vast gegeven voor de beslissing.
Lees hierna: OpenAI Beloofde Astra-Toegang Die Het Nog Niet Kon Leveren | Clifford stapt over naar Anthropic, blijft ARIA-baas



