Vad som hände på lanseringsdagen
OpenAI planerade att publicera sitt GPT-6 Astra-tillkännagivande klockan 14 amerikansk östkusttid den 3 september 2026. Inlägget gick upp, togs ner, dök upp som en död länk när OpenAIs eget konto twittrade det klockan 15.32, och blev först tillförlitligt synligt mellan ungefär 16.20 och 17.20, efter att Sam Altman redan hade delat länken igen.
Under de där få timmarna ändrades flera av benchmark-siffrorna i själva inlägget, inte bara en gång utan över flera på varandra följande ögonblicksbilder, innan några av dem återställdes till sina ursprungliga värden.
Siffrorna som rörde sig, ögonblicksbild för ögonblicksbild
Oberoende övervakning av sidans successiva versioner, rapporterad av Fortune, registrerade följande förändringar:
| Mått | Tidigt publicerat tal | Senare revidering | Var det står nu |
|---|---|---|---|
| Astra på ARC-AGI-3 | 98,6% (embargobelagt utkast) | 99,99% (live-blogg) | 99,99% |
| Astras hallucinationsfrekvens | 4,2% (första ögonblicksbild) | 2% (sjätte ögonblicksbild) | Återställd till 4,2% |
| GPT-5.6 Sols hallucinationsfrekvens | 12,2% (första versionen) | 9,4% (senare version) | Återställd till 12,2% |
| Claude Fable 5.1, FrontierMath Tier 4 | 87,8% (första versionen) | 78%, sedan 83% | 83% |
Ytterligare två mått rörde sig under samma tidsfönster: en ExploitBench-cybersäkerhetspoäng för GPT-5.6 Sol gick från 5,5 till 11,5 procent innan OpenAI sa att man utredde en återställning, och ett kodningsbenchmark för Astra steg från 57,7 till 57,9 procent.
OpenAIs förklaring, och varför den inte helt övertygade forskarna
OpenAI berättade för Fortune att man bryr sig djupt om att få utvärderingar rätt, och att de flesta utvärderingar har ett brus på några procentenheter beroende på exakt checkpoint, ställning och utvärderingskörning som används i rapporteringen. Företaget beskrev ändringarna som rättelser avsedda att spegla dess bästa uppskattning av tillgänglig modellprestanda.
Anka Reuel och Mike Hardy från Stanfords Intelligent Systems Laboratory och Trustworthy AI Lab sa att mönstret läses som benchmaxxing, att justera mot en bra rubriksiffra, och pekade på otillräcklig teknisk transparens om vad som exakt ändrades och varför. Vincent Sunn Chen från Snorkel AI var mer återhållsam och beskrev förskjutningarna som normal logistik i slutet av en lansering, men efterlyste ändå en branschnorm för att dokumentera vad som ändras mellan benchmark-revideringar och när.
Varför konkurrenternas siffror betyder mer än Astras egna
Att OpenAI justerar upp poängen för sin egen modell antyder ett uppenbart motiv. Den mer avslöjande detaljen är att en rivals siffror också rörde sig, i båda riktningarna, på samma sida, samma dag: Claude Fable 5.1s FrontierMath-poäng föll nio poäng och återhämtade sig sedan delvis, och Claude Fable 5.1 och Opus 5s HealthBench Professional-poäng justerades upp mitt under lanseringen innan de stabiliserades.
Att en leverantör rättar sitt eget påstående är rutin. Att en leverantörs lanseringssida också är platsen där en konkurrents offentliga poäng revideras, mer än en gång, innan branschen ens hunnit läsa klart den, är en annan sorts händelse, och det är den som gör detta till mer än en PR-fotnot, nämligen ett due diligence-problem.
Beslutet detta förändrar: vad ett benchmark-kort är värt i stunden man läser det
Varje företagsköpare som den här veckan citerade Astras lanseringsdagssiffror för ARC-AGI-3 eller hallucinationer i en inköpspromemoria citerade i praktiken en siffra som redan hade ändrats minst en gång och kunde ändras igen. Det finns i dag inget lagkrav på att ett AI-labb ska versionshantera och datera sina egna publicerade utvärderingspåståenden på samma sätt som en finansiell rapport dateras.
Den praktiska lösningen är billig och redan tillgänglig: ta en skärmdump eller arkivera benchmark-sidan i stunden man förlitar sig på den, notera den exakta siffran och tidsstämpeln i inköpsdokumentet, och behandla en jämförelsetabell från lanseringsdagen som ett påstående att verifiera innan ett kontrakt skrivs under, inte som en fast indata till beslutet.
Läs vidare: OpenAI Lovade Astra-Åtkomst Det Ännu Inte Kunde Leverera | Clifford gick till Anthropic, stannar kvar i ARIA



