Ce qui s'est passé le jour du lancement
OpenAI prévoyait de publier son annonce de GPT-6 Astra à 14h heure de l'Est le 3 septembre 2026. Le billet a été mis en ligne, retiré, réapparu sous forme de lien mort lorsque le compte d'OpenAI l'a publié sur Twitter à 15h32, et n'est devenu visible de façon fiable qu'entre environ 16h20 et 17h20, après que Sam Altman avait déjà repartagé le lien.
Pendant ces quelques heures, plusieurs des chiffres de référence du billet lui-même ont changé, pas une seule fois mais sur plusieurs instantanés successifs, avant que certains ne reviennent à leurs valeurs d'origine.
Les chiffres qui ont bougé, instantané par instantané
Un suivi indépendant des versions successives de la page, rapporté par Fortune, a enregistré les changements suivants :
| Indicateur | Chiffre publié au départ | Révision ultérieure | Où cela en est aujourd'hui |
|---|---|---|---|
| Astra sur ARC-AGI-3 | 98,6 % (brouillon sous embargo) | 99,99 % (blog en direct) | 99,99 % |
| Taux d'hallucination d'Astra | 4,2 % (premier instantané) | 2 % (sixième instantané) | Revenu à 4,2 % |
| Taux d'hallucination de GPT-5.6 Sol | 12,2 % (première version) | 9,4 % (version ultérieure) | Revenu à 12,2 % |
| Claude Fable 5.1, FrontierMath Tier 4 | 87,8 % (première version) | 78 %, puis 83 % | 83 % |
Deux autres indicateurs ont bougé dans la même fenêtre : un score de cybersécurité ExploitBench pour GPT-5.6 Sol est passé de 5,5 à 11,5 pour cent avant qu'OpenAI ne dise enquêter sur un retour en arrière, et un benchmark de programmation pour Astra est passé de 57,7 à 57,9 pour cent.
L'explication d'OpenAI, et pourquoi elle n'a pas pleinement convaincu les chercheurs
OpenAI a déclaré à Fortune tenir profondément à obtenir des évaluations justes, et que la plupart des évaluations comportent un bruit de quelques points de pourcentage selon le point de contrôle exact, l'échafaudage et l'exécution d'évaluation utilisés pour le rapport. L'entreprise a décrit les changements comme des corrections destinées à représenter sa meilleure estimation de la performance disponible du modèle.
Anka Reuel et Mike Hardy, du Intelligent Systems Laboratory et du Trustworthy AI Lab de Stanford, ont dit que ce schéma se lit comme du benchmaxxing, un ajustement vers un bon chiffre de titre, et ont pointé un manque de transparence technique sur ce qui a exactement changé et pourquoi. Vincent Sunn Chen, de Snorkel AI, s'est montré plus mesuré, présentant ces mouvements comme une logistique de fin de lancement normale, tout en appelant à une norme sectorielle documentant ce qui change entre les révisions d'un benchmark et quand.
Pourquoi les chiffres des concurrents comptent plus que ceux d'Astra elle-même
Qu'OpenAI corrige à la hausse les scores de son propre modèle suggère un motif évident. Le détail le plus révélateur est que les chiffres d'un rival ont eux aussi bougé, dans les deux sens, sur la même page, le même jour : le score FrontierMath de Claude Fable 5.1 a chuté de neuf points avant de se redresser partiellement, et les scores HealthBench Professional de Claude Fable 5.1 et Opus 5 ont été révisés à la hausse en plein lancement avant de se stabiliser.
Qu'un fournisseur corrige sa propre affirmation est routinier. Que la page de lancement d'un fournisseur soit aussi l'endroit où le score public d'un concurrent est révisé, plus d'une fois, avant même que le secteur ait fini de la lire, est un événement d'une autre nature, et c'est celui-ci qui transforme l'affaire d'une note de communication en un problème de diligence raisonnable.
La décision que cela change : ce que vaut une fiche de benchmark au moment où on la lit
Tout acheteur d'entreprise ayant cité cette semaine les chiffres de lancement d'Astra sur ARC-AGI-3 ou les hallucinations dans une note d'achat citait en réalité un chiffre déjà modifié au moins une fois et susceptible de changer encore. Il n'existe aujourd'hui aucune obligation réglementaire qu'un laboratoire d'IA versionne et date ses propres affirmations d'évaluation publiées comme on le fait pour un document financier déposé.
La solution pratique est peu coûteuse et disponible dès maintenant : capturer ou archiver la page du benchmark au moment où on s'y fie, noter le chiffre exact et l'horodatage dans le document d'achat, et traiter un tableau comparatif du jour du lancement comme une affirmation à revérifier avant de signer un contrat, pas comme une donnée fixe pour la décision.
À lire ensuite: OpenAI a Promis un Accès à Astra Qu'il Ne Pouvait Pas Livrer | Clifford rejoint Anthropic, reste à la tête d'ARIA



