Benchmarket Mistral valde att publicera

Mistral testade Agentic Search mot ett konkret prov: FinanceBench, ett benchmark byggt av 368 verkliga SEC-dokument och 150 frågor som var och en kräver att man hittar och korskontrollerar ett specifikt faktum i täta finansiella dokument.

Under Mistrals egen enstegs retrieval-augmented-generation-baslinje, där en modell bara läser det en enda sökning returnerar och svarar enbart utifrån det, låg noggrannheten på FinanceBench på 26,7 procent. Agentic Search, som låter modellen genomföra upprepade rundor av sökning, öppna enskilda dokument och verifiera sina egna resultat innan den svarar, höjde den siffran till 86 procent enligt Mistrals egna publicerade resultat. Ett hopp från ungefär ett korrekt svar av fyra till bättre än åtta av tio är ett betydande resultat för en enda produktuppdatering som bara rör själva sökskiktet.

Felmönstret Agentic Search riktar sig mot

Enstegs-RAG misslyckas för företagsanvändare på ett specifikt, återkommande sätt: det hämtar en handfull dokumentfragment i en enda omgång och tvingar modellen att svara enbart utifrån dem, även när det verkliga svaret finns i en tabell, en fotnot eller ett helt annat dokument.

Mistral byggde Agentic Search kring fem operationer som liknar vanliga filsystemkommandon: search, open, navigate, read och grep. Istället för att gissa utifrån en fast uppsättning hämtade fragment kan modellen öppna ett specifikt dokument, navigera till en tabell, läsa den omgivande kontexten och söka igen om det första svaret verkar ofullständigt. För en fråga som att hitta en enda ersättningsklausul bland hundratals SEC-dokument ligger denna iterativa process betydligt närmare hur en erfaren analytiker faktiskt arbetar än vad en enskild databasfråga någonsin kunde. Mistral framställer detta som bevis för att sökskiktet har varit den verkliga flaskhalsen i företagens AI-sökning.

Ett andra benchmark utesluter slumpen

Mistral stannade inte vid ett enda benchmark innan dessa noggrannhetssiffror publicerades.

OfficeQA Pro är ett separat test byggt av 696 Treasury-bulletiner och 133 frågor, som täcker en annan dokumenttyp och en annan sorts fråga än FinanceBench. Noggrannheten på OfficeQA Pro steg enligt Mistral från 6,3 procent med enstegsretrieval till 51,9 procent med den fullständiga agentiska slingan. De absoluta siffrorna är lägre än på FinanceBench eftersom frågorna i OfficeQA Pro är avsiktligt svårare, och resultatets form är densamma: en enstegsbaslinje som knappt svarar rätt på en av tjugo frågor, och en flerstegs sök- och verifieringsslinga som återvinner merparten av det gapet.

Vad tabellen visar om kostnad, inte bara noggrannhet

Flerstegssökning låter som att det borde kosta mer, och i Mistrals egna tester visade sig precis motsatsen vara sann.

MåttEnstegs-RAGAgentic Search
Noggrannhet FinanceBench26,7%86%
Noggrannhet OfficeQA Pro6,3%51,9%
p90-latens (FinanceBench)255s154s (-39,6%)
Tokenanvändningbaslinjeupp till -33% (en tredjedel)

Två benchmarks, en latensmätning och en tokenmätning rörde sig alla i samma riktning - den detalj Mistral lyfter fram för företagsköpare som funderar på om en mer grundlig sökprocess är värd den extra tekniska insatsen.

Vad on-premise faktiskt täcker för europeiska köpare

Agentic Search körs i Mistrals moln eller helt på en kunds egen infrastruktur, och on-premise-alternativet är den detalj som är mest relevant för europeiska och brittiska företag som utvärderar AI-sökleverantörer under krav på dataresidens.

De flesta AI-produkter som kombinerar stora språkmodeller med dokumenthämtning byggs och driftas uteslutande på amerikansk hyperscaler-infrastruktur, vilket tvingar europeiska köpare att under sin leverantörsgranskning acceptera att känsliga dokument lämnar organisationens egen miljö. Mistral, ett franskt AI-laboratorium, erbjuder en alternativ driftsättningsväg där sök- och hämtningsinfrastrukturen kan köras i en kunds eget datacenter eller privata moln. Det är en verklig och användbar skillnad, och den är snävare än full datasuveränitet: ett on-premise-alternativ beskriver var mjukvaran körs, inte en oberoende revision, en specifik efterlevnadscertifiering eller en garanti för hur den underliggande modellen tränades. Företag bör behandla det som en del av en leverantörsutvärdering, tillsammans med sin egen efterlevnadsgranskning.