El benchmark que Mistral decidió publicar

Mistral puso a prueba Agentic Search con un examen concreto: FinanceBench, un benchmark compuesto por 368 documentos reales presentados ante la SEC y 150 preguntas que exigen localizar y verificar un dato concreto dentro de documentos financieros densos.

Bajo la base de referencia de generación aumentada por recuperación de un solo paso propia de Mistral, en la que el modelo lee lo que devuelve una única búsqueda y responde solo con eso, la precisión en FinanceBench se situaba en el 26,7 por ciento. Agentic Search, que permite al modelo realizar varias rondas de búsqueda, abrir documentos concretos y verificar sus propios hallazgos antes de responder, elevó esa cifra al 86 por ciento, según los resultados publicados por la propia Mistral. Un salto de aproximadamente una respuesta correcta de cada cuatro a más de ocho de cada diez es un resultado importante para una sola actualización centrada en la capa de recuperación.

El fallo concreto que ataca Agentic Search

El RAG de un solo paso falla a los usuarios empresariales de una forma concreta y repetida: recupera un puñado de fragmentos de documentos en una única pasada y obliga al modelo a responder solo con eso, incluso cuando la respuesta real está en una tabla, una nota al pie o un documento completamente distinto.

Mistral construyó Agentic Search alrededor de cinco operaciones que recuerdan a comandos habituales de un sistema de archivos: search, open, navigate, read y grep. En lugar de adivinar a partir de un conjunto fijo de fragmentos recuperados, el modelo puede abrir un documento concreto, navegar hasta una tabla, leer el contexto circundante y volver a buscar si la primera respuesta parece incompleta. Para una pregunta como localizar una única cláusula de indemnización entre cientos de documentos de la SEC, ese proceso iterativo se acerca mucho más al trabajo real de un analista experimentado de lo que nunca pudo hacerlo una sola consulta a una base de datos. Mistral presenta esto como prueba de que la capa de recuperación ha sido el verdadero cuello de botella en la búsqueda empresarial con IA.

Un segundo benchmark descarta la casualidad

Mistral no se quedó en un único benchmark antes de publicar estas cifras de precisión.

OfficeQA Pro es una prueba independiente construida a partir de 696 boletines del Tesoro y 133 preguntas, que cubre un tipo de documento y un tipo de pregunta distintos de FinanceBench. La precisión en OfficeQA Pro subió, según Mistral, del 6,3 por ciento con recuperación de un solo paso al 51,9 por ciento con el bucle agéntico completo. Las cifras absolutas son más bajas que en FinanceBench porque las preguntas de OfficeQA Pro son deliberadamente más difíciles, y la forma del resultado es la misma: una base de referencia de un solo paso que apenas acierta una de cada veinte preguntas, y un bucle de búsqueda y verificación multietapa que recupera la mayor parte de esa diferencia.

Lo que muestra la tabla sobre el coste, no solo sobre la precisión

La búsqueda multietapa suena como si debiera costar más, y en las pruebas de la propia Mistral ocurrió justo lo contrario.

MétricaRAG de un solo pasoAgentic Search
Precisión en FinanceBench26,7%86%
Precisión en OfficeQA Pro6,3%51,9%
Latencia p90 (FinanceBench)255s154s (-39,6%)
Uso de tokensreferenciahasta -33% (un tercio)

Dos benchmarks, una medición de latencia y una medición de tokens se movieron todos en la misma dirección, el detalle que Mistral destaca ante los compradores empresariales que se preguntan si un proceso de búsqueda más exhaustivo merece el esfuerzo técnico adicional.

Lo que realmente cubre el despliegue local para compradores europeos

Agentic Search funciona en la nube de Mistral o por completo sobre la infraestructura propia de un cliente, y esa opción local es el detalle más relevante para las empresas europeas y británicas que evalúan proveedores de búsqueda con IA bajo requisitos de residencia de datos.

La mayoría de los productos de IA que combinan grandes modelos de lenguaje con recuperación de documentos se construyen y alojan exclusivamente sobre infraestructura de las grandes nubes estadounidenses, lo que obliga a los compradores europeos a aceptar, durante su revisión de proveedores, que documentos sensibles salgan del entorno propio de la organización. Mistral, un laboratorio de IA francés, ofrece una vía de despliegue alternativa en la que la infraestructura de búsqueda y recuperación puede funcionar dentro del propio centro de datos o la nube privada de un cliente. Se trata de una diferencia real y útil, y es más limitada que la soberanía de datos plena: una opción de despliegue local describe dónde se ejecuta el software, no una auditoría independiente, una certificación de cumplimiento concreta ni una garantía sobre cómo se entrenó el modelo subyacente. Las empresas deberían tratarlo como un elemento más de su evaluación de proveedores, junto a su propia revisión de cumplimiento.