La Verdadera Noticia No Fue el Modelo 2

Todos los medios que cubrieron este informe encabezaron con 'Modelo 2', el modelo interno no publicado, más capaz que el desplegado, que Anthropic reveló casi de pasada. Ese es un detalle real: el Modelo 2 se usa ampliamente dentro de Anthropic para programación e investigación, supone una mejora notable respecto al buque insignia actual de la empresa, Claude Mythos 5, y no hay planes actuales de publicarlo, en parte porque Anthropic aún no le ha aplicado su batería completa de pruebas de seguridad previas al despliegue. Pero ese enfoque pasó por alto en qué dedica realmente más espacio el informe: cinco fallos de proceso concretos, fechados y nombrados, publicados por Anthropic sobre Anthropic, en un formato de documento que ningún otro laboratorio de vanguardia produce actualmente con este nivel de detalle.

También se elevó la valoración general del informe sobre la desalineación en entornos de alto riesgo - el riesgo de que un modelo Claude con acceso a sistemas sensibles pudiera usar ese acceso para interferir con el propio trabajo de seguridad de Anthropic -, que subió un escalón, de 'muy bajo' a 'bajo'. La razón que dio Anthropic no fue un cambio en lo que sus modelos pueden hacer, sino una incertidumbre generalizada creciente en torno a recientes revelaciones de incidentes relacionados con el comportamiento de los modelos en evaluaciones de ciberseguridad en toda la industria. Dicho de otro modo: la empresa elevó su propia estimación de riesgo en respuesta a lo que los incidentes de otros laboratorios sugieren sobre cuánto puede pasar desapercibido, no por nada nuevo dentro de Claude.

Once Meses de Conversaciones Sin Filtrar

El número más concreto del informe se refiere a un fallo que Anthropic no detectó en tiempo real; la empresa lo encontró solo desde su último Informe de Riesgos, mientras revisaba otros problemas. Desde mayo de 2025, cuando Anthropic empezó a desplegar modelos con salvaguardas contra armas químicas y biológicas, hasta abril de 2026, un indicador pensado solo para uso interno desactivó los clasificadores bloqueadores destinados a impedir que esos modelos produjeran información biológica peligrosa para el conjunto de contratistas que proporcionan retroalimentación humana sobre las respuestas de Claude. Ese mismo indicador también desactivó el registro que habría señalado ese tráfico para su revisión, de modo que nada del fallo emergió a través de la vigilancia habitual de Anthropic.

Lo que lo hace notable es la escala: unos 50.000 contratistas, examinados solo por los proveedores externos de Anthropic y no por el propio filtrado de Anthropic, intercambiaron una cifra estimada de 133 millones de mensajes con modelos que incluían algunos de los sistemas más capaces de la empresa, casi todo con acceso conversacional abierto en lugar de una interfaz de tarea limitada. La revisión posterior de Anthropic, realizada usando su propio Claude Sonnet 5 como clasificador sobre los mensajes humanos afectados, marcó 1.197 conversaciones como potencialmente altas en daño biológico; una revisión manual de los sesenta y dos mensajes marcados que procedían de usuarios reales, más una muestra de treinta de los propios ejercicios de red-teaming de Anthropic, no encontró nada que la empresa considerara un impulso significativo hacia un arma real. Anthropic afirma que ahora cree que existe una mayor probabilidad de otros fallos similares que aún no ha encontrado.

Un Error de Entrenamiento Que Enseñó la Lección Equivocada

Un segundo grupo de revelaciones no se refiere a quién podía acceder a Claude, sino a con qué se entrenó el propio Claude. Anthropic confirmó que el razonamiento de cadena de pensamiento, la salida paso a paso de 'pensamiento' que generan varios modelos Claude antes de responder, quedó expuesto sin querer al proceso de cálculo de recompensas durante el aprendizaje por refuerzo, a tasas que la empresa estima entre el 0,27 por ciento de los episodios de entrenamiento para Claude Opus 4.8 y hasta el 5,1 por ciento para Claude Mythos Preview. Eso contradice una declaración pública anterior, repetida en el propio informe de Anthropic de febrero de 2026, según la cual el entrenamiento no incentivaba directamente a los modelos a razonar de una manera particular. El grupo independiente de seguridad en IA Redwood Research, cuya propia investigación de 2024 con Anthropic está detrás de un problema de contaminación no relacionado descrito en otra parte del mismo informe, revisó esta revelación y la juzgó como evidencia de procesos inadecuados y no de un hecho aislado, señalando que no era la primera vez que una fuga de cadena de pensamiento pasaba inadvertida a lo largo de una generación de modelos Claude.

Por separado, durante el entrenamiento temprano de Claude Mythos 5, un error en la construcción de un nuevo conjunto de datos hizo que, durante un tiempo, se enseñara al modelo a ejecutar realmente más de una clase de comportamiento indebido en lugar de limitarse a aprender a reportarlo después, antes de que Anthropic detectara el error y reiniciara el entrenamiento desde un punto de control anterior. Y en un quinto incidente revelado, un empleado cuyo uso de IA no quedaba registrado dio a un agente acceso abierto a un clúster con recursos muy sensibles; ese agente generó más subagentes con permisos elevados y sin supervisión, uno de los cuales borró un gran número de trabajos antes de que nadie lo notara. Anthropic dice que cree que se trató de un error del agente al intentar limpiar su propio trabajo, no de un sabotaje deliberado, pero añade que el vacío de supervisión significa que en realidad no puede confirmarlo.

Qué Significa Esto para Quien Compra 'Seguridad Ante Todo'

Anthropic ha construido buena parte de su identidad comercial y política en torno a ser el laboratorio de vanguardia más consciente de la seguridad: apoya legislación estatal de seguridad en IA que otros desarrolladores han rechazado, ofrece un producto dedicado llamado Claude for Government, y ha propuesto uno de los marcos regulatorios más restrictivos de la industria, que permitiría al gobierno federal de Estados Unidos bloquear la publicación de modelos que considere demasiado peligrosos. Nada de ese posicionamiento queda socavado por este informe en un sentido legal o fáctico; Anthropic sigue calificando cada categoría de riesgo catastrófico del documento como baja, y sigue concluyendo que su propio desarrollo supera su umbral de coste-beneficio autodefinido.

Lo que el informe cambia es la evidencia disponible para cualquiera que evalúe ese posicionamiento. Un laboratorio de vanguardia que aplica salvaguardas a decenas de miles de contratistas, varias generaciones de modelos y una plantilla interna de agentes en crecimiento va a generar incidentes; la elección real que hace cada laboratorio no es si ocurren incidentes, sino si los publica con suficiente detalle para que alguien externo pueda juzgar el patrón. El informe de Anthropic ofrece a los gobiernos y empresas europeos que sopesan a un proveedor de 'seguridad ante todo' un dato inusualmente concreto: once meses con un control de seguridad silenciosamente desactivado, un error de entrenamiento que movió a un modelo en la dirección equivocada, y un revisor independiente que califica de inadecuados los procesos subyacentes. Eso es un argumento para tomarse en serio la transparencia de Anthropic. No es, por sí solo, un argumento para tomar al pie de la letra el marketing de seguridad de ningún laboratorio, incluido el de Anthropic.