Un agente pequeño frente a dos gigantes de la IA
Inherent, un laboratorio de IA con sede en Londres fundado por antiguos investigadores de DeepMind, afirmó que su agente Faraday superó tanto a Claude Opus 4.8 de Anthropic como a GPT-5.5 de OpenAI al reproducir de forma independiente los resultados de artículos científicos publicados.
Faraday se basa en Qwen 3.6, un modelo base de pesos abiertos con 27.000 millones de parámetros, mucho más pequeño que los sistemas de referencia contra los que se midió. La tarea no era una simple pregunta y respuesta: los investigadores dieron a Faraday el planteamiento de un artículo publicado y le pidieron reproducir el resultado sin conocer la respuesta de antemano, y luego compararon su salida con la de los dos modelos mucho más grandes sobre los mismos artículos. Inherent publicó la metodología y los resultados en su propia página de investigación, y la comparación fue confirmada de forma independiente por TechCrunch.
El resultado llega solo semanas después de que Inherent saliera del sigilo con una ronda semilla de 50 millones de dólares, inusualmente grande para un laboratorio de IA europeo, y una apuesta a que un agente pequeño y bien entrenado puede competir con sistemas de empresas que gastan mucho más en cómputo.
Por qué ganó: instinto, no solo tamaño
El mecanismo: según Inherent, Faraday fue entrenado para desarrollar un "instinto de investigación", la capacidad de saber qué experimentos merecen la pena y cómo diseñarlos bien, mediante aprendizaje por refuerzo que premia los buenos resultados en lugar de seguir un manual de pasos correctos.
Ese enfoque apunta a una habilidad más acotada que el razonamiento general: saber replicar el hallazgo de un artículo concreto es una tarea limitada, y un modelo más pequeño entrenado específicamente para ello puede superar de forma plausible a un modelo de referencia general que nunca se optimizó para esa tarea exacta. Esto ocurre en un contexto de costes crecientes de cómputo de referencia: Nvidia ha comunicado a grandes clientes de la nube que los precios de los servidores de IA para entregas de 2027 subirán más de un 15 por ciento, impulsados por el coste de la memoria, lo que encarece elegir por defecto el modelo más grande disponible para cada tarea.
Qué significa para los compradores de IA
La conclusión: un agente especializado, una fracción del tamaño de un modelo de referencia, que le gana en una tarea bien definida es una prueba de que el tamaño del modelo no es la única palanca que las empresas europeas y británicas deberían usar al presupuestar capacidad de IA.
Los equipos de compras y tecnología que evalúan proveedores de IA para una tarea concreta y bien definida, desde la revisión de documentos hasta la migración de código o el apoyo a la investigación, tienen ahora un motivo concreto para probar modelos más pequeños y entrenados con un propósito frente a los modelos generales de referencia antes de comprometerse con la opción más grande y cara. Los laboratorios de referencia siguen por delante en razonamiento general y amplio; la afirmación aquí es más acotada y específica de la tarea, no que Faraday sustituya a Claude o GPT-5.5 en todos los ámbitos.
La conclusión final
Que un laboratorio británico supere a dos laboratorios de referencia estadounidenses bien financiados en una tarea científica concreta, seis meses después de su fundación, es un dato real a favor de la competitividad europea en IA, y un recordatorio de que la carrera del cómputo no es la única que importa.
Leer a continuación: Las descargas de Qwen ocultan un vacío legal en la UE | Alibaba ocultó la cifra que fija su coste



