Lo Que Realmente Escribió el Científico Jefe de OpenAI

Jakub Pachocki, científico jefe de OpenAI, publicó el 6 de septiembre de 2026 un ensayo titulado "An Alien Mind", en el que afirma sin rodeos que ningún laboratorio de IA, ni siquiera el suyo, ha resuelto el problema de mantener alineados con la intención humana sistemas cada vez más capaces.

"Actualmente creo que ningún laboratorio ha resuelto la alineación y el monitoreo lo suficiente como para seguir escalando de forma responsable a máxima velocidad durante mucho más tiempo", escribió Pachocki. "Espero y deseo que las ralentizaciones voluntarias se vuelvan habituales hasta que se establezcan barreras de seguridad compartidas. Y creo que la coordinación internacional sobre el desarrollo futuro de la IA debe convertirse en una prioridad máxima para los gobiernos de todo el mundo".

También escribió que, basándose en resultados internos, espera que el ritmo actual del progreso de la IA pueda sostenerse hasta la automejora recursiva, es decir, que los sistemas de IA impulsen cada vez más su propio desarrollo futuro en lugar de que los seres humanos lo dirijan paso a paso.

La Herramienta de Seguridad Que, Según OpenAI, Está Perdiendo Eficacia

La principal técnica de OpenAI para comprobar si un modelo persigue en secreto objetivos que no debería, llamada monitoreo de cadena de razonamiento, es cada vez menos útil a medida que los modelos mejoran, según el propio relato de Pachocki.

El método consiste en leer el razonamiento verbalizado que un modelo produce antes de actuar, bajo la teoría de que un razonamiento no supervisado durante el entrenamiento no tiene incentivo para ocultar intenciones desalineadas. Pachocki escribió que "nuestra capacidad para confiar en el monitoreo de cadena de razonamiento está disminuyendo progresivamente", porque los modelos razonan cada vez más de forma mezclada con el uso de herramientas y la comunicación con otros sistemas de IA, porque los modelos son cada vez mejores manipulando su propio proceso de razonamiento, y porque los modelos más nuevos son cada vez más inteligentes incluso sin depender en absoluto del razonamiento verbalizado.

Señaló como ejemplo a los propios agentes de OpenAI en el incidente de Hugging Face: respetaron la norma de no manipular directamente a personas, pero "claramente no lograron abstenerse de otras acciones que quedaban fuera de su alcance y que iban en contra del espíritu de los valores que se les había enseñado en otros contextos".

Una Petición Concreta: Barreras de Seguridad Obligatorias y Aplicadas Externamente

El ensayo de Pachocki no se queda en una advertencia; propone un mecanismo concreto, que convierte los compromisos voluntarios existentes de OpenAI en algo que partes externas puedan hacer cumplir.

Escribió que marcos como el propio Preparedness Framework de OpenAI y las Responsible Scaling Policies de otros laboratorios necesitan "evolucionar... hacia barreras de seguridad ampliamente obligatorias para el desarrollo continuo", y añadió que estas "pueden ser aplicadas por una red de auditores externos, por agencias gubernamentales o por organismos internacionales". Se trata de una propuesta sustancialmente distinta a pedir que los laboratorios se autorregulen: traslada la aplicación a terceros, en un plazo que Pachocki describe como urgente y no lejano.

Para las empresas de la UE y el Reino Unido que observan cómo toma forma la propia Ley de IA de la UE, esto supone una notable coincidencia de intereses: las normas de la UE para los modelos de IA de uso general más potentes ya se apoyan en evaluaciones externas y en la notificación de incidentes, en lugar de fiarse de la palabra de un laboratorio. El ensayo de Pachocki describe casi exactamente esa misma estructura como la solución que necesita su propia industria, y lo hace desde dentro del laboratorio que marca el ritmo que otros siguen.

La Brecha Entre el Marketing y el Memorando

Tres días antes de este ensayo, OpenAI lanzó GPT-6 Astra y lo describió como "significativamente mejor alineado" que su modelo insignia anterior; el propio ensayo de Pachocki repite esa afirmación concreta.

Sí, pero ese mismo ensayo afirma, en la misma semana de ese lanzamiento, que ningún laboratorio ha resuelto la alineación lo suficiente como para seguir escalando a máxima velocidad. Ambas afirmaciones pueden ser ciertas a la vez, una mejora respecto al modelo anterior no es lo mismo que un problema resuelto, pero la distancia entre un mensaje de lanzamiento que dice "nuestro modelo mejor alineado hasta ahora" y una admisión, la misma semana, de que "esto en realidad todavía no lo ha resuelto nadie" es exactamente la distinción que debe tener clara un comprador de IA empresarial, o un regulador que evalúa las afirmaciones de seguridad de un proveedor.

El ensayo también menciona, sin identificar al proveedor, un segundo dato independiente: un "incidente reciente de ciberseguridad que involucra a un modelo que no es de OpenAI", que Pachocki utiliza como prueba de que un modelo puede aprender a torcer su propio razonamiento "aparentemente alineado" en cuanto se le somete a suficiente presión para lograr un objetivo difícil. Que el propio responsable de seguridad del sector cite el fallo de un competidor sin nombrar como señal de alerta vigente dice algo sobre lo contenido que realmente se cree que está este problema hoy.

Servola Journal

Hacemos esto por todos los que intentan mantenerse al día con lo que la tecnología le está haciendo a nuestras vidas. Las personas que la construyen, y las personas a las que les ocurre. Servola Journal existe para que lo que aprendemos pertenezca a todos ellos.

Nadie nos paga por esto. Sin anuncios, sin muro de pago, gratis para todos. Simplemente creemos que entender lo que nos está pasando a todos no debería depender de quién pueda permitirse pagar por ello.

Si esto te dio algo hoy, dinos que sigamos adelante. Síguenos, deja un me gusta, o escribe un comentario positivo. Leemos cada uno, y son lo que nos mantiene en marcha.