Un laboratorio midió su propia máquina

El 17 de septiembre, Anthropic publicó la primera versión pública de lo que llama el R&D Automation Index, un marcador que la empresa construyó para medir cuánto de su propia investigación y desarrollo de IA realiza ahora Claude en lugar de su personal humano. La cifra principal: Claude lidera actualmente el 26 por ciento de ese trabajo, frente a menos del 1 por ciento en febrero de 2026, y más del 90 por ciento de las tareas relevantes se sitúan ya en el nivel que Anthropic llama la IA colabora o por encima de él. Unos 30.000 agentes de IA trabajan en tareas de investigación e ingeniería dentro de la empresa en cualquier momento dado, según una medición de una semana entre el 13 y el 20 de julio.

El índice clasifica cada tarea en una escala de seis niveles de automatización construida junto con Epoch AI, desde AL0, sin participación de IA, hasta AL5, donde la IA opera de forma totalmente autónoma sin ningún humano involucrado. Anthropic dice que ninguna tarea ha llegado aún a AL5. El motivo de publicar esta cifra, según la empresa, es que el público necesita más información sobre la velocidad a la que un laboratorio puede mejorar su propia IA usando esa misma IA, un ritmo que normalmente resulta invisible desde fuera.

La vigilancia es más delgada que el trabajo

Una cuarta parte de la investigación de Anthropic pasa ya por Claude con un humano supervisando en lugar de realizar el trabajo directamente, y la propia empresa acompaña esa cifra con datos sobre cuán de cerca dice estar vigilando. Un monitor automático en línea que revisa las decisiones de investigación de Claude en tiempo real bloquea solo el 0,002 por ciento de ellas, aproximadamente una entre 47.000. Un proceso de revisión fuera de línea distinto marca solo entre una y dos transcripciones de cada mil para que un humano las revise después.

MedidaCifra reportada por Anthropic
Cuota de I+D en IA liderada por Claude26 por ciento (desde menos del 1 por ciento en feb. 2026)
Trabajo en el nivel la IA colabora o superiorMás del 90 por ciento
Tasa de bloqueo del monitor en línea0,002 por ciento de las decisiones (cerca de 1 de 47.000)
Transcripciones marcadas para revisión humana1 a 2 de cada 1.000

Nada de esto significa que el trabajo carezca de supervisión. Significa que la supervisión es estadística en lugar de constante, capta una porción pequeña y muestreada de las decisiones en vez de leerlas todas, justo en el momento en que la propia empresa dice que el margen de decisiones que Claude toma por sí mismo se está ampliando.

Seis niveles, y nadie está aún en el último

La escala de Anthropic describe cómo es realmente cada nivel de automatización dentro de una tarea de investigación, y la distancia entre los niveles que la empresa reporta y la cima de la escala es la verdadera historia detrás de las cifras.

NivelQué significa
AL0Sin participación de IA
AL1La IA asiste de forma mínima
AL2La IA asiste de forma más sustancial, el humano sigue liderando
AL3La IA colabora, hace grandes partes del trabajo bajo dirección humana cercana
AL4La IA lidera, completa el trabajo de principio a fin desde una instrucción general mientras un humano supervisa
AL5Totalmente autónoma, ningún humano involucrado

La propia cita de Anthropic plantea el riesgo con claridad: a medida que el trabajo se automatiza más, los agentes podrían tomar decisiones más consecuentes, como qué dirección de investigación seguir después, y esas decisiones necesitan salvaguardas contra el comportamiento dañino de un solo agente además de un régimen de supervisión que detecte problemas en todos ellos. La empresa está describiendo AL4, no AL5, pero la distancia entre ambos es un solo paso, no un muro fijo.

Una empresa redacta su propio examen

Anthropic no se limita a reportar una cifra aquí. Propone que los gobiernos usen medidas como esta para fijar obligaciones de transparencia y para definir los detonantes de exigencias más estrictas, como una ventana de pruebas fija antes de que un nuevo modelo pueda encargarse de más trabajo de I+D en IA por sí mismo. Es una idea real y útil. También es un laboratorio escribiendo el primer borrador del examen que espera que le pongan, usando telemetría que hoy solo él posee.

Ninguna disposición del Reglamento de IA de la UE vincula hoy una obligación de riesgo sistémico para modelos GPAI al nivel de automatización propio de un laboratorio, ni a cuánto de su cómputo de seguridad se dedica a vigilar su porción automatizada del trabajo, según Anthropic actualmente el 6 por ciento del cómputo total de I+D en IA, que sube al 12 por ciento dentro de la parte de ese trabajo impulsada por IA. Cualquier empresa europea que hoy compre acceso a modelos de frontera para su propia hoja de ruta de producto debería leer esto menos como una historia de Anthropic y más como un adelanto de la pregunta que un regulador, o el equipo de compras de un cliente, terminará haciendo a todo proveedor de IA: cuánto de lo que me vende fue construido por algo que usted no vigilaba por completo, y cómo lo sabe.