Co się wydarzyło w dniu premiery

OpenAI planowało opublikować zapowiedź GPT-6 Astra o 14:00 czasu wschodniego USA 3 września 2026 roku. Wpis pojawił się online, został wycofany, ponownie ukazał się jako martwy link, gdy własne konto OpenAI opublikowało go na Twitterze o 15:32, i stał się wiarygodnie widoczny dopiero między około 16:20 a 17:20, już po tym, jak Sam Altman ponownie udostępnił link.

W tym kilkugodzinnym oknie kilka liczb z benchmarków w samym wpisie zmieniło się, nie raz, lecz w kolejnych zrzutach, zanim część z nich wróciła do pierwotnych wartości.

Liczby, które się zmieniały, zrzut po zrzucie

Niezależne monitorowanie kolejnych wersji strony, opisane przez Fortune, odnotowało następujące zmiany:

WskaźnikWczesna opublikowana liczbaPóźniejsza korektaStan obecny
Astra w ARC-AGI-398,6% (wersja embargowana)99,99% (blog na żywo)99,99%
Wskaźnik halucynacji Astry4,2% (pierwszy zrzut)2% (szósty zrzut)Przywrócono do 4,2%
Wskaźnik halucynacji GPT-5.6 Sol12,2% (pierwsza wersja)9,4% (późniejsza wersja)Przywrócono do 12,2%
Claude Fable 5.1, FrontierMath Tier 487,8% (pierwsza wersja)78%, potem 83%83%

Jeszcze dwa wskaźniki zmieniły się w tym samym oknie czasowym: wynik cyberbezpieczeństwa ExploitBench dla GPT-5.6 Sol przesunął się z 5,5 do 11,5 procent, zanim OpenAI oświadczyło, że bada cofnięcie zmiany, a benchmark programistyczny dla Astry wzrósł z 57,7 do 57,9 procent.

Wyjaśnienie OpenAI i dlaczego nie w pełni przekonało badaczy

OpenAI powiedziało Fortune, że firmie bardzo zależy na rzetelności ocen i że większość ocen ma szum rzędu kilku punktów procentowych, zależnie od dokładnego checkpointu, rusztowania i przebiegu oceny użytego przy raportowaniu. Firma opisała zmiany jako poprawki mające odzwierciedlać jej najlepsze oszacowanie dostępnej wydajności modelu.

Anka Reuel i Mike Hardy ze Stanford Intelligent Systems Laboratory i Trustworthy AI Lab powiedzieli, że ten wzorzec wygląda na benchmaxxing, czyli dostrajanie w stronę dobrej liczby na nagłówek, i wskazali na niewystarczającą przejrzystość techniczną co do tego, co dokładnie się zmieniło i dlaczego. Vincent Sunn Chen z Snorkel AI był bardziej powściągliwy, określając te przesunięcia jako normalną logistykę końcową premiery, ale mimo to wezwał do branżowej normy dokumentującej, co zmienia się między korektami benchmarków i kiedy.

Dlaczego liczby konkurencji liczą się bardziej niż własne liczby Astry

To, że OpenAI koryguje wyniki własnego modelu w górę, sugeruje oczywisty motyw. Bardziej wymownym szczegółem jest to, że liczby rywala również się zmieniały, w obu kierunkach, na tej samej stronie, tego samego dnia: wynik FrontierMath Claude Fable 5.1 spadł o dziewięć punktów, a potem częściowo się odbił, a wyniki HealthBench Professional Claude Fable 5.1 i Opus 5 zostały skorygowane w górę w trakcie premiery, zanim się ustabilizowały.

To, że dostawca koryguje własne twierdzenie, jest rutyną. To, że strona premierowa dostawcy jest też miejscem, gdzie publiczny wynik konkurenta jest korygowany, więcej niż raz, zanim branża zdąży w ogóle skończyć jej czytać, to zupełnie inny rodzaj zdarzenia, i to on zamienia to z notatki prasowej w problem należytej staranności.

Decyzja, którą to zmienia: ile warta jest karta benchmarku w chwili, gdy się ją czyta

Każdy firmowy kupujący, który w tym tygodniu przywołał premierowe liczby Astry dotyczące ARC-AGI-3 lub halucynacji w notatce zakupowej, w praktyce cytował liczbę, która już zmieniła się co najmniej raz i mogła zmienić się ponownie. Dziś nie istnieje żaden wymóg regulacyjny, by laboratorium AI wersjonowało i datowało własne opublikowane twierdzenia ewaluacyjne tak, jak wersjonuje się i datuje sprawozdanie finansowe.

Praktyczne rozwiązanie jest tanie i dostępne już teraz: zrobić zrzut ekranu lub zarchiwizować stronę benchmarku w chwili, gdy się na niej polega, odnotować dokładną liczbę i znacznik czasu w dokumencie zakupowym, i traktować tabelę porównawczą z dnia premiery jako twierdzenie do ponownej weryfikacji przed podpisaniem umowy, a nie jako stałe dane wejściowe do decyzji.