Il benchmark che Mistral ha scelto di pubblicare

Mistral ha messo alla prova Agentic Search su un banco di prova preciso: FinanceBench, un benchmark composto da 368 documenti reali depositati presso la SEC e 150 domande, ciascuna delle quali richiede di individuare e verificare un fatto specifico all'interno di documenti finanziari densi.

Nella linea di base RAG a passaggio singolo di Mistral, in cui il modello si limita a leggere quanto restituito da un'unica ricerca e risponde soltanto sulla base di quello, la precisione su FinanceBench si fermava al 26,7 per cento. Agentic Search, che consente al modello di svolgere più cicli di ricerca, aprire singoli documenti e verificare i propri risultati prima di rispondere, ha portato quella cifra all'86 per cento, secondo i risultati pubblicati dalla stessa Mistral. Un salto da circa una risposta corretta su quattro a oltre otto su dieci è un risultato rilevante per un singolo aggiornamento di prodotto che riguarda solo il livello di recupero delle informazioni.

Il tipo di errore che Agentic Search affronta

Il RAG a passaggio singolo delude gli utenti aziendali in un modo preciso e ricorrente: recupera una manciata di frammenti di documento in un unico passaggio e costringe il modello a rispondere solo sulla base di quelli, anche quando la risposta reale si trova in una tabella, in una nota a piè di pagina o in un documento completamente diverso.

Mistral ha costruito Agentic Search attorno a cinque operazioni che ricordano i comandi tipici di un file system: search, open, navigate, read e grep. Invece di indovinare a partire da un insieme fisso di frammenti recuperati, il modello può aprire un documento specifico, spostarsi fino a una tabella, leggere il contesto circostante e cercare di nuovo se la prima risposta appare incompleta. Per una domanda come individuare un'unica clausola di indennizzo tra centinaia di documenti SEC, questo processo iterativo si avvicina molto di più al modo in cui lavora davvero un analista esperto di quanto abbia mai potuto fare una singola interrogazione a un database. Mistral presenta questo dato come prova che il livello di recupero è stato il vero collo di bottiglia nella ricerca aziendale basata sull'IA.

Un secondo benchmark esclude il caso fortuito

Mistral non si è fermata a un solo benchmark prima di pubblicare questi dati di precisione.

OfficeQA Pro è un test distinto, costruito su 696 bollettini del Tesoro e 133 domande, che copre un tipo di documento e un tipo di domanda diversi da FinanceBench. Secondo Mistral, la precisione su OfficeQA Pro è salita dal 6,3 per cento con il recupero a passaggio singolo al 51,9 per cento con il ciclo agentico completo. I valori assoluti sono più bassi rispetto a FinanceBench perché le domande di OfficeQA Pro sono deliberatamente più difficili, ma la forma del risultato resta la stessa: una linea di base a passaggio singolo che risponde correttamente a stento a una domanda su venti, e un ciclo di ricerca e verifica multifase che recupera gran parte di quel divario.

Cosa mostra la tabella sul costo, non solo sulla precisione

La ricerca multifase sembra dover costare di più, ma nei test della stessa Mistral è successo esattamente il contrario.

MetricaRAG a passaggio singoloAgentic Search
Precisione FinanceBench26,7%86%
Precisione OfficeQA Pro6,3%51,9%
Latenza p90 (FinanceBench)255s154s (-39,6%)
Uso di tokenvalore di riferimentofino a -33% (un terzo)

Due benchmark, una misurazione della latenza e una misurazione dei token si sono mossi tutti nella stessa direzione: il dettaglio che Mistral sottolinea agli acquirenti aziendali che si chiedono se un processo di ricerca più approfondito valga lo sforzo tecnico aggiuntivo.

Cosa copre davvero l'opzione on-premise per gli acquirenti europei

Agentic Search funziona nel cloud di Mistral oppure interamente sull'infrastruttura del cliente, e questa opzione on-premise è il dettaglio più rilevante per le aziende europee e britanniche che valutano fornitori di ricerca IA alla luce dei requisiti sulla residenza dei dati.

La maggior parte dei prodotti IA che uniscono grandi modelli linguistici al recupero di documenti viene costruita e ospitata esclusivamente su infrastrutture dei grandi cloud statunitensi, il che costringe gli acquirenti europei, durante la verifica dei fornitori, ad accettare che documenti sensibili escano dall'ambiente proprio dell'organizzazione. Mistral, laboratorio di IA francese, offre un percorso di implementazione alternativo in cui l'infrastruttura di ricerca e recupero può funzionare all'interno del data center o del cloud privato del cliente. Si tratta di una distinzione reale e utile, più limitata però della piena sovranità dei dati: un'opzione di implementazione on-premise descrive dove viene eseguito il software, non un audit indipendente, una certificazione di conformità specifica o una garanzia su come è stato addestrato il modello sottostante. Le aziende dovrebbero considerarla come un elemento della propria valutazione dei fornitori, insieme alla propria verifica di conformità.