Benchmark, który Mistral zdecydował się opublikować

Mistral przetestował Agentic Search na konkretnym sprawdzianie: FinanceBench, benchmarku zbudowanym z 368 prawdziwych dokumentów SEC i 150 pytań, z których każde wymaga znalezienia i zweryfikowania konkretnego faktu wewnątrz gęstych dokumentów finansowych.

W ramach własnego, jednoetapowego podejścia RAG Mistrala, w którym model odczytuje jedynie to, co zwraca pojedyncze wyszukiwanie, i odpowiada wyłącznie na tej podstawie, dokładność w FinanceBench wynosiła 26,7 procent. Agentic Search, który pozwala modelowi przeprowadzać powtarzane rundy wyszukiwania, otwierania pojedynczych dokumentów i weryfikowania własnych ustaleń przed udzieleniem odpowiedzi, podniósł ten wynik do 86 procent, według opublikowanych wyników samego Mistrala. Skok z mniej więcej jednej poprawnej odpowiedzi na cztery do ponad ośmiu na dziesięć to znaczący rezultat jak na pojedynczą aktualizację produktu dotyczącą wyłącznie warstwy wyszukiwania.

Rodzaj błędu, z którym mierzy się Agentic Search

Jednoetapowy RAG zawodzi użytkowników biznesowych w konkretny, powtarzalny sposób: pobiera garść fragmentów dokumentów w jednym przebiegu i zmusza model do odpowiadania wyłącznie na ich podstawie, nawet gdy prawdziwa odpowiedź znajduje się w tabeli, w przypisie albo w zupełnie innym dokumencie.

Mistral zbudował Agentic Search wokół pięciu operacji przypominających typowe polecenia systemu plików: search, open, navigate, read i grep. Zamiast zgadywać na podstawie stałego zestawu pobranych fragmentów, model może otworzyć konkretny dokument, przejść do tabeli, przeczytać otaczający kontekst i wyszukać ponownie, jeśli pierwsza odpowiedź wygląda na niepełną. Przy pytaniu takim jak znalezienie jednej klauzuli odszkodowawczej wśród setek dokumentów SEC, ten iteracyjny proces jest znacznie bliższy temu, jak faktycznie pracuje wyszkolony analityk, niż kiedykolwiek mogło być pojedyncze zapytanie do bazy danych. Mistral przedstawia to jako dowód, że warstwa wyszukiwania była prawdziwym wąskim gardłem w biznesowym wyszukiwaniu opartym na AI.

Drugi benchmark wyklucza przypadek

Mistral nie poprzestał na jednym benchmarku przed opublikowaniem tych wyników dokładności.

OfficeQA Pro to osobny test zbudowany z 696 biuletynów Skarbu Państwa i 133 pytań, obejmujący inny typ dokumentu i inny rodzaj pytań niż FinanceBench. Dokładność w OfficeQA Pro wzrosła, według Mistrala, z 6,3 procent przy wyszukiwaniu jednoetapowym do 51,9 procent przy pełnej pętli agentowej. Wartości bezwzględne są niższe niż w FinanceBench, ponieważ pytania w OfficeQA Pro są celowo trudniejsze, a kształt wyniku pozostaje ten sam: jednoetapowa linia bazowa, która poprawnie odpowiada zaledwie na jedno pytanie na dwadzieścia, oraz wieloetapowa pętla wyszukiwania i weryfikacji, która odzyskuje większość tej różnicy.

Co tabela pokazuje o kosztach, nie tylko o dokładności

Wyszukiwanie wieloetapowe brzmi tak, jakby musiało kosztować więcej, a we własnych testach Mistrala okazało się dokładnie odwrotnie.

WskaźnikRAG jednoetapowyAgentic Search
Dokładność FinanceBench26,7%86%
Dokładność OfficeQA Pro6,3%51,9%
Opóźnienie p90 (FinanceBench)255s154s (-39,6%)
Zużycie tokenówwartość bazowado -33% (jedna trzecia)

Dwa benchmarki, jeden pomiar opóźnienia i jeden pomiar zużycia tokenów poruszyły się w tym samym kierunku - to szczegół, który Mistral podkreśla wobec firmowych nabywców zastanawiających się, czy bardziej dokładny proces wyszukiwania jest wart dodatkowego wysiłku technicznego.

Co opcja lokalna faktycznie obejmuje dla europejskich nabywców

Agentic Search działa w chmurze Mistrala albo całkowicie na własnej infrastrukturze klienta, a ta opcja lokalna jest szczegółem najistotniejszym dla europejskich i brytyjskich firm oceniających dostawców wyszukiwania AI w kontekście wymogów rezydencji danych.

Większość produktów AI łączących duże modele językowe z wyszukiwaniem dokumentów jest budowana i hostowana wyłącznie na infrastrukturze amerykańskich dostawców chmury, co zmusza europejskich nabywców, podczas oceny dostawców, do zaakceptowania, że wrażliwe dokumenty opuszczają własne środowisko organizacji. Mistral, francuskie laboratorium AI, oferuje alternatywną ścieżkę wdrożenia, w której infrastruktura wyszukiwania i pobierania danych może działać wewnątrz własnego centrum danych klienta lub jego prywatnej chmury. To realna i użyteczna różnica, węższa jednak niż pełna suwerenność danych: opcja wdrożenia lokalnego opisuje, gdzie działa oprogramowanie, a nie niezależny audyt, konkretną certyfikację zgodności ani gwarancję dotyczącą sposobu wytrenowania leżącego u podstaw modelu. Firmy powinny traktować to jako jeden z elementów oceny dostawcy, obok własnego przeglądu zgodności.