Qué ocurrió el día del lanzamiento
OpenAI planeaba publicar su anuncio de GPT-6 Astra a las 14:00 hora del Este el 3 de septiembre de 2026. La entrada se publicó, se retiró, reapareció como un enlace roto cuando la propia cuenta de OpenAI lo publicó en Twitter a las 15:32, y solo se pudo ver de forma fiable entre aproximadamente las 16:20 y las 17:20, después de que Sam Altman ya hubiera vuelto a compartir el enlace.
A lo largo de esas pocas horas, varias de las cifras de referencia de la propia entrada cambiaron, no una sola vez sino en múltiples instantáneas, antes de que algunas volvieran a sus valores originales.
Las cifras que se movieron, instantánea a instantánea
El seguimiento independiente de las versiones sucesivas de la página, recogido por Fortune, registró los siguientes cambios:
| Metrica | Cifra publicada al principio | Revision posterior | Donde queda ahora |
|---|---|---|---|
| Astra en ARC-AGI-3 | 98,6% (borrador embargado) | 99,99% (blog en directo) | 99,99% |
| Tasa de alucinacion de Astra | 4,2% (primera instantanea) | 2% (sexta instantanea) | Revertida a 4,2% |
| Tasa de alucinacion de GPT-5.6 Sol | 12,2% (primera version) | 9,4% (version posterior) | Revertida a 12,2% |
| Claude Fable 5.1, FrontierMath Tier 4 | 87,8% (primera version) | 78%, luego 83% | 83% |
Otras dos métricas se movieron en la misma ventana: una puntuación de ciberseguridad ExploitBench para GPT-5.6 Sol pasó del 5,5 al 11,5 por ciento antes de que OpenAI dijera que investigaba una reversión, y un benchmark de programación para Astra subió del 57,7 al 57,9 por ciento.
La explicación de OpenAI, y por qué no convenció del todo a los investigadores
OpenAI dijo a Fortune que le importa profundamente obtener evaluaciones correctas, y que la mayoría de las evaluaciones tienen un margen de ruido de unos pocos puntos porcentuales según el checkpoint exacto, el andamiaje y la ejecución de evaluación usados al reportar. La empresa describió los cambios como correcciones destinadas a representar su mejor estimación del rendimiento disponible del modelo.
Anka Reuel y Mike Hardy, del Intelligent Systems Laboratory y el Trustworthy AI Lab de Stanford, dijeron que el patrón se lee como benchmaxxing, es decir, ajustar hacia una buena cifra de titular, y señalaron una transparencia técnica insuficiente sobre qué cambió exactamente y por qué. Vincent Sunn Chen, de Snorkel AI, fue más comedido y enmarcó los cambios como logística normal de última hora del lanzamiento, pero aun así pidió una norma del sector para documentar qué cambia entre revisiones de benchmark y cuándo.
Por qué las cifras de la competencia importan más que las de la propia Astra
Que OpenAI corrija al alza las puntuaciones de su propio modelo sugiere un motivo obvio. El detalle más revelador es que las cifras de un rival también se movieron, en ambas direcciones, en la misma página, el mismo día: la puntuación de FrontierMath de Claude Fable 5.1 cayó nueve puntos y luego se recuperó parcialmente, y las puntuaciones de HealthBench Professional de Claude Fable 5.1 y Opus 5 se revisaron al alza en pleno lanzamiento antes de estabilizarse.
Que un proveedor corrija su propia afirmación es rutinario. Que la página de lanzamiento de un proveedor sea también el lugar donde la puntuación pública de un competidor se revisa, más de una vez, antes de que el sector termine de leerla, es un tipo de suceso distinto, y es el que convierte esto de una nota de prensa en un problema de diligencia debida.
La decisión que esto cambia: cuánto vale una ficha de benchmark en el momento en que la lees
Cualquier comprador empresarial que citara esta semana las cifras de lanzamiento de Astra en ARC-AGI-3 o alucinaciones en un informe de compra estaba, en la práctica, citando una cifra que ya había cambiado al menos una vez y podía volver a cambiar. Hoy no existe ninguna obligación regulatoria de que un laboratorio de IA versione y feche sus propias afirmaciones de evaluación publicadas como se hace con una declaración financiera.
La solución práctica es barata y está disponible ya: capturar o archivar la página del benchmark en el momento en que se usa como referencia, anotar la cifra exacta y la hora en el documento de compra, y tratar una tabla comparativa del día del lanzamiento como una afirmación por verificar antes de firmar un contrato, no como un dato fijo para la decisión.
Leer a continuación: OpenAI Prometió un Acceso a Astra Que Aún No Podía Dar | Clifford ficha por Anthropic, sigue en ARIA



