Det benchmark Mistral valgte at offentliggøre
Mistral testede Agentic Search på en konkret prøve: FinanceBench, et benchmark bygget af 368 rigtige SEC-dokumenter og 150 spørgsmål, som hver især kræver, at man finder og krydstjekker et bestemt faktum inde i tætte finansielle dokumenter.
Under Mistrals egen etrins retrieval-augmented-generation-baseline, hvor en model kun læser det, en enkelt søgning returnerer, og svarer alene ud fra det, lå nøjagtigheden på FinanceBench på 26,7 procent. Agentic Search, der lader modellen gennemføre gentagne runder af søgning, åbning af enkelte dokumenter og verifikation af egne resultater, før den svarer, løftede det tal til 86 procent ifølge Mistrals egne offentliggjorte resultater. Et spring fra cirka ét korrekt svar ud af fire til bedre end otte ud af ti er et betydeligt resultat for en enkelt produktopdatering, der kun rammer søgelaget.
Den fejltype Agentic Search retter sig mod
Etrins-RAG fejler over for virksomhedsbrugere på en bestemt, tilbagevendende måde: det henter en håndfuld dokumentfragmenter i én omgang og tvinger modellen til kun at svare ud fra dem, selv når det rigtige svar står i en tabel, en fodnote eller et helt andet dokument.
Mistral byggede Agentic Search op omkring fem operationer, der minder om almindelige filsystemkommandoer: search, open, navigate, read og grep. I stedet for at gætte ud fra et fast sæt hentede fragmenter kan modellen åbne et bestemt dokument, navigere til en tabel, læse den omgivende kontekst og søge igen, hvis det første svar virker ufuldstændigt. Til et spørgsmål som at finde en enkelt erstatningsklausul blandt hundredvis af SEC-dokumenter kommer denne gentagne proces langt tættere på, hvordan en trænet analytiker rent faktisk arbejder, end et enkelt databaseopslag nogensinde kunne. Mistral fremstiller dette som bevis for, at søgelaget har været den egentlige flaskehals i virksomheders AI-søgning.
Et andet benchmark udelukker tilfældighed
Mistral stoppede ikke ved ét benchmark, før disse nøjagtighedstal blev offentliggjort.
OfficeQA Pro er en separat test bygget af 696 Treasury-bulletiner og 133 spørgsmål, der dækker en anden dokumenttype og en anden slags spørgsmål end FinanceBench. Nøjagtigheden på OfficeQA Pro steg ifølge Mistral fra 6,3 procent med etrins-retrieval til 51,9 procent med den fulde agentiske sløjfe. De absolutte tal er lavere end på FinanceBench, fordi spørgsmålene i OfficeQA Pro med vilje er sværere, og resultatets form er den samme: en etrins-baseline, der næppe svarer korrekt på ét ud af tyve spørgsmål, og en flertrins søge- og verifikationssløjfe, der genvinder størstedelen af den forskel.
Hvad tabellen viser om omkostninger, ikke kun om nøjagtighed
Flertrins-søgning lyder, som om det burde koste mere, og i Mistrals egne test viste det stik modsatte sig at være sandt.
| Måltal | Etrins-RAG | Agentic Search |
|---|---|---|
| Nøjagtighed FinanceBench | 26,7% | 86% |
| Nøjagtighed OfficeQA Pro | 6,3% | 51,9% |
| p90-latens (FinanceBench) | 255s | 154s (-39,6%) |
| Tokenforbrug | baseline | op til -33% (en tredjedel) |
To benchmarks, én latensmåling og én tokenmåling bevægede sig alle i samme retning - den detalje Mistral fremhæver over for virksomhedskøbere, der overvejer, om en mere grundig søgeproces er den ekstra tekniske indsats værd.
Hvad on-premise reelt dækker for europæiske købere
Agentic Search kører i Mistrals sky eller helt på en kundes egen infrastruktur, og den on-premise-mulighed er den detalje, der er mest relevant for europæiske og britiske virksomheder, der vurderer AI-søgeleverandører under krav om dataresidens.
De fleste AI-produkter, der kombinerer store sprogmodeller med dokumentretrieval, bygges og hostes udelukkende på amerikansk hyperscaler-infrastruktur, hvilket tvinger europæiske købere til under leverandørgennemgang at acceptere, at følsomme dokumenter forlader organisationens eget miljø. Mistral, et fransk AI-laboratorium, tilbyder en alternativ implementeringsvej, hvor søge- og retrieval-infrastrukturen kan køre inde i en kundes eget datacenter eller private sky. Det er en reel og nyttig forskel, og den er snævrere end fuld datasuverænitet: en on-premise-implementeringsmulighed beskriver, hvor softwaren kører - ikke en uafhængig revision, en bestemt compliance-certificering eller en garanti for, hvordan den underliggende model blev trænet. Virksomheder bør behandle det som ét element i en leverandørvurdering, sammen med deres egen compliance-gennemgang.
Læs videre: 4.000 apps på 30 dage: Cloudflares AI-satsning | Mistral deler suveræn AI i to væddemål



