Lo que Anthropic realmente comunicó
El 10 de agosto de 2026, Anthropic publicó una nota de investigación que describe qué ocurrió cuando la empresa dirigió una versión de investigación no publicada de Claude hacia la hipótesis de Riemann, esa conjetura de 1859 según la cual todo cero no trivial de la función zeta de Riemann tiene parte real igual a un medio. Claude no demostró la hipótesis. Hizo avanzar una pregunta abierta más concreta y con décadas de antigüedad: qué fracción de esos ceros pueden los matemáticos demostrar con rigor que se sitúa sobre esa línea crítica. El récord anterior, en manos desde 2020 de Kyle Pratt, Nicolas Robles, Alexandru Zaharescu y Dirk Zeindler, situaba esa fracción demostrable en el 41,6 por ciento.
La ejecución de investigación de Claude elevó la fracción al 67,2 por ciento, un resultado que según Anthropic fue en realidad un subproducto de un intento más amplio sobre la hipótesis completa y no el objetivo original. La empresa formula la cifra con cautela: se trata de un resultado de cota inferior sobre un subproblema concreto y bien definido, no de un paso que resuelva ni se espere que resuelva la conjetura de 167 años en sí misma.
Dentro del enjambre de 60 agentes
La mecánica es la parte más inusual de la historia. Trabajando dentro de Claude Code a lo largo de dos sesiones, el modelo pasó aproximadamente un día y medio, del orden de 36 horas, coordinando unos 60 subagentes de Claude. Consumió 31 millones de tokens de salida y emitió unos 2.400 comandos de shell. De los 60 agentes, solo 2 desarrollaron la idea matemática que finalmente funcionó; 13 aportaron piezas de apoyo a esa idea; 30 intentaron enfoques alternativos y fracasaron; y 13 actuaron como validadores, revisando el trabajo en lugar de generarlo. Antes de dar con la línea de ataque exitosa, el enjambre ya había probado y descartado unas 650 ideas anteriores.
La idea que desbloqueó el problema consistió en tratar los ceros dentro y fuera de la línea crítica como puntos de un único espacio geométrico unificado en lugar de analizar los dos casos por separado, lo que produjo una desigualdad subyacente más fuerte. El enfoque se apoyó en trabajos publicados de los matemáticos Baluyot, Goldston, Suriajaya y Turnage-Butterbaugh, combinados con un artículo de Enrico Bombieri del año 2000, lo que significa que el modelo prolongaba un hilo de investigación humano existente en lugar de inventar el campo desde cero.
Por qué la prueba en Lean es el detalle que importa
Que un modelo de lenguaje de gran tamaño afirme una nueva cota matemática no es, por sí solo, prueba de nada: los modelos producen con regularidad demostraciones fluidas pero erróneas. Lo que cambia aquí es que Claude no se limitó a enunciar el resultado, sino que produjo una formalización en Lean, un asistente de pruebas que verifica cada paso lógico frente a un conjunto fijo de axiomas y reglas de inferencia, sin margen para la vaguedad. Anthropic informa de que la formalización en Lean supera la validación automatizada estándar, lo que constituye un tipo de evidencia categóricamente distinto al de un modelo que simplemente afirma que una cifra es cierta.
Además de la verificación automática, Anthropic hizo revisar el artículo por expertos externos: los teóricos de números Brian Conrey y Dan Goldston examinaron el trabajo con muy poco margen de tiempo, junto a los propios matemáticos de Anthropic, Levent Alpoge y Ralph Furman. Esa combinación, un verificador formal de pruebas más expertos humanos identificados por su nombre y dispuestos a poner su firma en una revisión, es lo que distingue este caso del flujo constante de afirmaciones matemáticas de IA sin verificar que circulan sin que nadie las compruebe.
Cómo se compara con 37 años de progreso humano
La referencia histórica es lo que hace legible el salto. El progreso en esta cota concreta ha sido un esfuerzo lento y prolongado durante décadas: G. H. Hardy demostró por primera vez en 1914 que hay infinitos ceros sobre la línea crítica, Atle Selberg probó que lo hace una proporción positiva, Norman Levinson alcanzó alrededor de un tercio en 1974, el propio Brian Conrey alcanzó alrededor de dos quintos en 1989, y el equipo Pratt-Robles-Zaharescu-Zeindler llegó al 41,6 por ciento en 2020. En conjunto, los matemáticos humanos desplazaron esa fracción demostrable unos 0,8 puntos porcentuales en los 37 años anteriores a esta ejecución.
El enjambre de Claude la desplazó 25,6 puntos porcentuales en aproximadamente un día y medio. Esto no es una afirmación de que las máquinas sean ahora mejores matemáticas que las personas que pasaron esos 37 años construyendo las herramientas en las que Claude se apoyó; la ejecución se basó explícitamente en resultados humanos publicados por Baluyot, Goldston, Suriajaya, Turnage-Butterbaugh y Bombieri. Es una afirmación sobre la velocidad a la que puede avanzar una búsqueda bien dotada de recursos y bien verificada una vez que existen los cimientos y un gran enjambre de agentes puede explorarlos de forma exhaustiva.
Qué revela sobre la trayectoria de capacidades de los laboratorios punteros
El modelo utilizado era explícitamente no publicado y de uso exclusivo para investigación, lo cual ya resulta revelador. Significa que la brecha de capacidad entre lo que un laboratorio puntero puede demostrar internamente y lo que llega a los clientes de pago es lo bastante amplia como para producir un resultado así antes de que el modelo subyacente sea público. Anthropic, OpenAI y Google DeepMind han publicado cada uno resultados de este tipo relacionados con las matemáticas en los últimos dos años, y el patrón es constante: se usan versiones de investigación internas para explorar los techos de capacidad en problemas difíciles y verificables mucho antes de cualquier lanzamiento comercial.
La arquitectura importa tanto como el modelo. Esto no fue una única conversación larga que produjo una única respuesta larga; fue orquestación, decenas de subagentes trabajando en paralelo, la mayoría fracasando, con el proceso principal gestionando la exploración y una capa de validadores revisando el trabajo candidato. Ese patrón de enjambre más verificador, y no el tamaño bruto del modelo, parece ser la parte que los laboratorios punteros están escalando más rápido en este momento, y es la parte con más probabilidades de aparecer en herramientas agénticas comerciales mucho antes de que un laboratorio afirme haber resuelto un problema abierto de matemática pura.
Qué deberían extraer realmente los responsables de I+D europeos
El teorema en sí no cambiará ningún balance. Lo transferible para una empresa europea con alta intensidad de I+D, un grupo farmacéutico que ejecuta cribados de moléculas, un proveedor de automoción que itera sobre materiales, un fabricante de semiconductores que valida diseños de circuitos, es el flujo de trabajo: un gran enjambre de agentes atacando un problema en paralelo, la mayoría de los cuales se espera que fracasen, controlado por un verificador formal o automatizado capaz de rechazar respuestas incorrectas sin que un humano tenga que revisar cada candidato. Esa combinación permitió que un día y medio de cómputo superara 37 años de trabajo humano riguroso y acreditado sobre esta única cuestión concreta.
La salvedad honesta es que las matemáticas tienen algo que la mayoría de los problemas de I+D corporativos no tienen: Lean, un verificador capaz de demostrar la corrección sin ambigüedad alguna. La ciencia de materiales, las interacciones farmacológicas y la validación de circuitos tienen equivalentes parciales, conjuntos de simulación, ensayos físicos, herramientas de verificación formal para la lógica de chips, pero rara vez algo tan hermético como una prueba en Lean. La conclusión realista para un responsable de I+D europeo que evalúa flujos de trabajo asistidos por IA no es esperar pronto un momento hipótesis-de-Riemann en su propio dominio; es preguntarse cuál de las herramientas de verificación ya existentes en su organización, por parcial que sea, podría convertirse en ese control automatizado que hace que un gran enjambre de agentes sea digno de confianza y no solo rápido.
Leer a continuación: Cognizant ha formado a 30.000 de 350.000 en Claude | Le pidieron reservar una clase de gimnasio. Pirateó el sistema de reservas.



