Le benchmark que Mistral a choisi de publier

Mistral a testé Agentic Search sur un examen précis : FinanceBench, un benchmark composé de 368 documents réels déposés auprès de la SEC et de 150 questions exigeant chacune de retrouver et de vérifier un fait précis au sein de documents financiers denses.

Dans la base de référence RAG à une seule étape propre à Mistral, où le modèle se contente de lire ce que renvoie une unique recherche et répond uniquement à partir de cela, la précision sur FinanceBench plafonnait à 26,7 pour cent. Agentic Search, qui permet au modèle d'effectuer plusieurs cycles de recherche, d'ouvrir des documents précis et de vérifier ses propres résultats avant de répondre, a fait grimper ce chiffre à 86 pour cent, selon les résultats publiés par Mistral elle-même. Un bond d'environ une réponse correcte sur quatre à plus de huit sur dix constitue un résultat important pour une seule mise à jour de produit portant uniquement sur la couche de récupération.

Le type d'échec que vise Agentic Search

Le RAG à une seule étape échoue auprès des utilisateurs en entreprise d'une manière précise et récurrente : il récupère une poignée de fragments de documents en un seul passage et force le modèle à répondre uniquement à partir de ceux-ci, même lorsque la vraie réponse se trouve dans un tableau, une note de bas de page ou un document entièrement différent.

Mistral a construit Agentic Search autour de cinq opérations qui rappellent des commandes classiques de système de fichiers : search, open, navigate, read et grep. Plutôt que de deviner à partir d'un ensemble fixe de fragments récupérés, le modèle peut ouvrir un document précis, naviguer jusqu'à un tableau, lire le contexte environnant et relancer une recherche si la première réponse semble incomplète. Pour une question comme retrouver une seule clause d'indemnisation parmi des centaines de documents de la SEC, ce processus itératif se rapproche bien davantage du travail réel d'un analyste chevronné qu'une simple requête de base de données n'a jamais pu le faire. Mistral présente cela comme la preuve que la couche de récupération a été le véritable goulot d'étranglement de la recherche IA en entreprise.

Un second benchmark écarte le coup de chance

Mistral ne s'est pas arrêtée à un seul benchmark avant de publier ces chiffres de précision.

OfficeQA Pro est un test distinct construit à partir de 696 bulletins du Trésor et de 133 questions, couvrant un type de document et un type de question différents de FinanceBench. La précision sur OfficeQA Pro est passée, selon Mistral, de 6,3 pour cent avec une récupération en une seule étape à 51,9 pour cent avec la boucle agentique complète. Les chiffres absolus sont plus bas que sur FinanceBench parce que les questions d'OfficeQA Pro sont volontairement plus difficiles, et la forme du résultat reste la même : une base de référence en une seule étape qui répond correctement à peine à une question sur vingt, et une boucle de recherche et de vérification en plusieurs étapes qui comble l'essentiel de cet écart.

Ce que le tableau révèle sur le coût, pas seulement sur la précision

Une recherche en plusieurs étapes devrait, en théorie, coûter plus cher, et c'est l'inverse exact qui s'est produit dans les propres tests de Mistral.

IndicateurRAG en une étapeAgentic Search
Précision sur FinanceBench26,7%86%
Précision sur OfficeQA Pro6,3%51,9%
Latence p90 (FinanceBench)255s154s (-39,6%)
Usage de tokensréférencejusqu'à -33% (un tiers)

Deux benchmarks, une mesure de latence et une mesure de tokens ont tous évolué dans la même direction, le détail que Mistral met en avant auprès des acheteurs en entreprise qui se demandent si un processus de recherche plus approfondi vaut l'effort technique supplémentaire.

Ce que l'option sur site couvre réellement pour les acheteurs européens

Agentic Search fonctionne dans le cloud de Mistral ou entièrement sur l'infrastructure propre d'un client, et cette option sur site est le détail le plus pertinent pour les entreprises européennes et britanniques qui évaluent des fournisseurs de recherche IA sous des exigences de résidence des données.

La plupart des produits d'IA qui combinent de grands modèles de langage avec la récupération de documents sont construits et hébergés exclusivement sur des infrastructures de grands fournisseurs de cloud américains, ce qui oblige les acheteurs européens, lors de leur diligence raisonnable, à accepter que des documents sensibles quittent l'environnement propre de leur organisation. Mistral, un laboratoire d'IA français, propose une voie de déploiement alternative où l'infrastructure de recherche et de récupération peut fonctionner dans le centre de données ou le cloud privé propre d'un client. Il s'agit d'une distinction réelle et utile, et elle reste plus étroite qu'une pleine souveraineté des données : une option de déploiement sur site décrit uniquement l'endroit où le logiciel s'exécute, pas un audit indépendant, une certification de conformité précise, ni une garantie sur la manière dont le modèle sous-jacent a été entraîné. Les entreprises devraient la considérer comme un élément parmi d'autres de leur évaluation des fournisseurs, aux côtés de leur propre revue de conformité.