Cosa è successo il giorno del lancio

OpenAI aveva in programma di pubblicare l'annuncio di GPT-6 Astra alle 14:00 ora dell'Est del 3 settembre 2026. Il post è andato online, è stato ritirato, è riapparso come link non funzionante quando l'account di OpenAI lo ha twittato alle 15:32, ed è diventato visibile in modo affidabile solo tra circa le 16:20 e le 17:20, dopo che Sam Altman aveva già ricondiviso il link.

In quell'arco di poche ore, diversi numeri di benchmark nel post stesso sono cambiati, non una sola volta ma in più scatti successivi, prima che alcuni tornassero ai valori originali.

I numeri che si sono mossi, scatto dopo scatto

Il monitoraggio indipendente delle versioni successive della pagina, riportato da Fortune, ha registrato questi cambiamenti:

MetricaCifra pubblicata all'inizioRevisione successivaSituazione attuale
Astra su ARC-AGI-398,6% (bozza sotto embargo)99,99% (blog live)99,99%
Tasso di allucinazione di Astra4,2% (primo snapshot)2% (sesto snapshot)Riportato a 4,2%
Tasso di allucinazione di GPT-5.6 Sol12,2% (prima versione)9,4% (versione successiva)Riportato a 12,2%
Claude Fable 5.1, FrontierMath Tier 487,8% (prima versione)78%, poi 83%83%

Altre due metriche si sono mosse nella stessa finestra: un punteggio di sicurezza informatica ExploitBench per GPT-5.6 Sol è passato dal 5,5 all'11,5 per cento prima che OpenAI dichiarasse di stare indagando su un ripristino, e un benchmark di programmazione per Astra è salito dal 57,7 al 57,9 per cento.

La spiegazione di OpenAI, e perché non ha convinto del tutto i ricercatori

OpenAI ha detto a Fortune di tenere molto a ottenere valutazioni corrette, e che la maggior parte delle valutazioni comporta un margine di rumore di alcuni punti percentuali a seconda del checkpoint esatto, dell'impalcatura e dell'esecuzione di valutazione usati nel riportare i dati. L'azienda ha descritto le modifiche come correzioni pensate per rappresentare la sua migliore stima delle prestazioni disponibili del modello.

Anka Reuel e Mike Hardy dello Stanford Intelligent Systems Laboratory e del Trustworthy AI Lab hanno detto che lo schema si legge come benchmaxxing, cioè ottimizzare verso un buon numero da titolo, e hanno segnalato una trasparenza tecnica insufficiente su cosa sia cambiato esattamente e perché. Vincent Sunn Chen di Snorkel AI è stato più misurato, inquadrando gli spostamenti come normale logistica finale di lancio, ma ha comunque chiesto una norma di settore per documentare cosa cambia tra le revisioni di un benchmark e quando.

Perché i numeri dei concorrenti contano più di quelli di Astra stessa

Che OpenAI corregga al rialzo i punteggi del proprio modello suggerisce un movente ovvio. Il dettaglio più rivelatore è che si sono mossi anche i numeri di un rivale, in entrambe le direzioni, sulla stessa pagina, lo stesso giorno: il punteggio FrontierMath di Claude Fable 5.1 è sceso di nove punti per poi recuperare in parte, e i punteggi HealthBench Professional di Claude Fable 5.1 e Opus 5 sono stati rivisti al rialzo a lancio in corso prima di stabilizzarsi.

Che un fornitore corregga la propria affermazione è normale amministrazione. Che la pagina di lancio di un fornitore sia anche il luogo dove il punteggio pubblico di un concorrente viene rivisto, più di una volta, prima che il settore finisca di leggerla, è un tipo di evento diverso, ed è quello che trasforma tutto questo da una nota di colore a un problema di due diligence.

La decisione che questo cambia: quanto vale una scheda di benchmark nel momento in cui la si legge

Qualsiasi acquirente aziendale che questa settimana abbia citato i numeri di lancio di Astra su ARC-AGI-3 o sulle allucinazioni in un promemoria di acquisto stava, di fatto, citando un numero già cambiato almeno una volta e che poteva cambiare di nuovo. Oggi non esiste alcun obbligo normativo che imponga a un laboratorio di IA di versionare e datare le proprie affermazioni di valutazione pubblicate come si fa con un bilancio depositato.

La soluzione pratica è economica e già disponibile: catturare o archiviare la pagina del benchmark nel momento in cui ci si basa su di essa, annotare la cifra esatta e l'orario nel documento di acquisto, e trattare una tabella comparativa del giorno del lancio come un'affermazione da riverificare prima di firmare un contratto, non come un dato fisso per la decisione.