Un piccolo agente contro due giganti dell'IA

Inherent, un laboratorio di IA con sede a Londra fondato da ex ricercatori di DeepMind, ha dichiarato che il suo agente Faraday ha superato sia Claude Opus 4.8 di Anthropic sia GPT-5.5 di OpenAI nel riprodurre in modo indipendente i risultati di articoli scientifici pubblicati.

Faraday si basa su Qwen 3.6, un modello open-weight da 27 miliardi di parametri, molto più piccolo dei sistemi di riferimento contro cui è stato testato. Il compito non era una semplice domanda e risposta: i ricercatori hanno dato a Faraday l'impostazione di un articolo pubblicato e gli hanno chiesto di riprodurre il risultato senza conoscere la risposta in anticipo, confrontando poi il suo output con quello dei due modelli molto più grandi sugli stessi articoli. Inherent ha pubblicato metodologia e risultati sulla propria pagina di ricerca, e il confronto è stato riportato in modo indipendente da TechCrunch.

Il risultato arriva poche settimane dopo che Inherent è uscita dalla modalità stealth con un round seed da 50 milioni di dollari, insolitamente ampio per un laboratorio di IA europeo, e una scommessa sul fatto che un agente piccolo e ben addestrato possa competere con sistemi di aziende che spendono molto di più in calcolo.

Perché ha vinto: istinto, non solo dimensione

Il meccanismo: secondo Inherent, Faraday è stato addestrato a sviluppare un "istinto di ricerca", la capacità di capire quali esperimenti vale la pena condurre e come progettarli bene, tramite apprendimento per rinforzo che premia i buoni risultati invece di seguire un manuale di passaggi corretti.

Questo approccio punta a un'abilità più ristretta del ragionamento generale: sapere come replicare il risultato di un articolo specifico è un compito limitato, e un modello più piccolo addestrato appositamente per questo può plausibilmente superare un modello di riferimento generale mai ottimizzato per quel compito esatto. Questo avviene sullo sfondo di costi di calcolo di riferimento in aumento: Nvidia ha comunicato ai grandi clienti cloud che i prezzi dei server IA per le consegne del 2027 aumenteranno di oltre il 15 per cento, spinti dai costi della memoria, il che rende più costoso scegliere di default il modello più grande disponibile per ogni compito.

Cosa significa per chi compra IA

La conclusione: un agente specializzato, una frazione delle dimensioni di un modello di riferimento, che lo batte in un compito ben definito, è una prova che la dimensione del modello non è l'unica leva su cui le aziende europee e britanniche dovrebbero contare nel budget per le capacità di IA.

I team acquisti e tecnici che valutano fornitori di IA per un compito preciso e ben definito, dalla revisione documentale alla migrazione del codice fino al supporto alla ricerca, hanno ora un motivo concreto per testare modelli più piccoli e addestrati a uno scopo specifico contro modelli generali di riferimento prima di impegnarsi con l'opzione più grande e costosa. I laboratori di riferimento restano avanti sul ragionamento generale e ampio; l'affermazione qui è più ristretta e specifica per il compito, non che Faraday sostituisca Claude o GPT-5.5 in generale.

La conclusione finale

Un laboratorio britannico che batte due laboratori di riferimento statunitensi ben finanziati in un compito scientifico preciso, sei mesi dopo la sua fondazione, è un dato reale a favore della competitività europea nell'IA, e un promemoria che la corsa al calcolo non è l'unica che conta.