De benchmark die Mistral koos om te publiceren
Mistral testte Agentic Search op een specifieke proef: FinanceBench, een benchmark opgebouwd uit 368 echte SEC-documenten en 150 vragen die elk vereisen dat een specifiek feit wordt gevonden en gecontroleerd in dichte financiële documenten.
Onder Mistrals eigen eenmalige retrieval-augmented-generation-basislijn, waarbij een model alleen leest wat een enkele zoekopdracht oplevert en daar uitsluitend op antwoordt, lag de nauwkeurigheid op FinanceBench op 26,7 procent. Agentic Search, dat het model toestaat herhaalde rondes van zoeken, het openen van afzonderlijke documenten en het verifiëren van eigen bevindingen uit te voeren voordat het antwoordt, verhoogde dat cijfer volgens Mistrals eigen gepubliceerde resultaten naar 86 procent. Een sprong van ongeveer een op de vier juiste antwoorden naar meer dan acht op de tien is een aanzienlijk resultaat voor een enkele productupdate die alleen de retrievallaag raakt.
Het faalpatroon waarop Agentic Search zich richt
Eenmalige RAG faalt bij zakelijke gebruikers op een specifieke, terugkerende manier: het haalt in een enkele stap een handvol documentfragmenten op en dwingt het model om alleen daarop te antwoorden, zelfs wanneer het echte antwoord in een tabel, een voetnoot of een geheel ander document staat.
Mistral bouwde Agentic Search rond vijf bewerkingen die lijken op gewone bestandssysteemcommando's: search, open, navigate, read en grep. In plaats van te gokken op basis van een vaste set opgehaalde fragmenten, kan het model een specifiek document openen, naar een tabel navigeren, de omringende context lezen en opnieuw zoeken als het eerste antwoord onvolledig lijkt. Voor een vraag als het vinden van een enkele vrijwaringsclausule tussen honderden SEC-documenten komt dit iteratieve proces veel dichter bij hoe een ervaren analist daadwerkelijk werkt dan een enkele databasequery ooit kon. Mistral presenteert dit als bewijs dat de retrievallaag het echte knelpunt is geweest in zakelijke AI-zoekopdrachten.
Een tweede benchmark sluit toeval uit
Mistral bleef niet bij een enkele benchmark voordat het deze nauwkeurigheidscijfers publiceerde.
OfficeQA Pro is een aparte test, opgebouwd uit 696 Treasury-bulletins en 133 vragen, die een ander documenttype en een ander soort vraag bestrijkt dan FinanceBench. De nauwkeurigheid op OfficeQA Pro steeg volgens Mistral van 6,3 procent met eenmalige retrieval naar 51,9 procent met de volledige agentische lus. De absolute cijfers liggen lager dan bij FinanceBench omdat de vragen van OfficeQA Pro bewust moeilijker zijn, en de vorm van het resultaat blijft hetzelfde: een eenmalige retrieval-basislijn die amper een op de twintig vragen goed beantwoordt, en een meerstaps zoek- en verificatielus die het grootste deel van dat gat herstelt.
Wat de tabel laat zien over kosten, niet alleen over nauwkeurigheid
Meerstaps zoeken klinkt alsof het meer zou moeten kosten, en in Mistrals eigen tests bleek precies het tegendeel waar.
| Metriek | Eenmalige RAG | Agentic Search |
|---|---|---|
| Nauwkeurigheid FinanceBench | 26,7% | 86% |
| Nauwkeurigheid OfficeQA Pro | 6,3% | 51,9% |
| p90-latentie (FinanceBench) | 255s | 154s (-39,6%) |
| Tokengebruik | basislijn | tot -33% (een derde) |
Twee benchmarks, een latentiemeting en een tokenmeting bewogen allemaal in dezelfde richting - het detail dat Mistral benadrukt bij zakelijke kopers die afwegen of een grondiger zoekproces de extra technische inspanning waard is.
Wat on-premise werkelijk dekt voor Europese kopers
Agentic Search draait in Mistrals cloud of volledig op de eigen infrastructuur van een klant, en die on-premise optie is het detail dat het meest relevant is voor Europese en Britse bedrijven die AI-zoekleveranciers beoordelen onder eisen voor dataresidentie.
De meeste AI-producten die grote taalmodellen combineren met documentretrieval worden uitsluitend gebouwd en gehost op infrastructuur van Amerikaanse hyperscalers, wat Europese kopers tijdens hun leveranciersonderzoek dwingt te accepteren dat gevoelige documenten de eigen omgeving van de organisatie verlaten. Mistral, een Frans AI-lab, biedt een alternatief implementatiepad waarbij de zoek- en retrieval-infrastructuur kan draaien binnen het eigen datacenter of de eigen private cloud van een klant. Dat is een echt en nuttig onderscheid, en het is smaller dan volledige datasoevereiniteit: een on-premise implementatieoptie beschrijft waar de software draait, niet een onafhankelijke audit, een specifieke compliancecertificering of een garantie over hoe het onderliggende model is getraind. Bedrijven zouden dit moeten behandelen als een van de onderdelen van hun leveranciersbeoordeling, naast hun eigen compliancecontrole.
Lees hierna: 4.000 apps in 30 dagen: Cloudflares AI-gok | Mistral splitst soevereine AI in twee weddenschappen



