Un petit agent face à deux géants de l'IA
Inherent, un laboratoire d'IA basé à Londres et fondé par d'anciens chercheurs de DeepMind, affirme que son agent Faraday a surpassé à la fois Claude Opus 4.8 d'Anthropic et GPT-5.5 d'OpenAI dans la reproduction indépendante de résultats d'articles scientifiques publiés.
Faraday s'appuie sur Qwen 3.6, un modèle de base à poids ouverts de 27 milliards de paramètres, bien plus petit que les systèmes de référence face auxquels il a été testé. La tâche n'était pas une simple question-réponse : les chercheurs ont donné à Faraday le protocole d'un article publié et lui ont demandé de reproduire le résultat sans connaître la réponse à l'avance, puis ont comparé sa production à celle des deux modèles bien plus grands sur les mêmes articles. Inherent a publié la méthodologie et les résultats sur sa propre page de recherche, et la comparaison a été rapportée de manière indépendante par TechCrunch.
Le résultat arrive quelques semaines seulement après qu'Inherent est sortie du mode furtif avec 50 millions de dollars levés lors d'un tour d'amorçage, exceptionnellement important pour un laboratoire d'IA européen, et un pari selon lequel un agent petit et bien entraîné peut rivaliser avec des systèmes d'entreprises qui dépensent bien plus en calcul.
Pourquoi il a gagné : le flair, pas seulement la taille
Le mécanisme : selon Inherent, Faraday a été entraîné à développer un "flair de recherche", un instinct pour savoir quelles expériences valent la peine d'être menées et comment bien les concevoir, via un apprentissage par renforcement qui récompense les bons résultats plutôt que de suivre un manuel d'étapes correctes.
Cette approche vise une compétence plus étroite que le raisonnement général : savoir reproduire le résultat d'un article précis est une tâche bornée, et un modèle plus petit entraîné spécifiquement pour cela peut plausiblement surpasser un modèle de référence général qui n'a jamais été optimisé pour cette tâche exacte. Cela survient alors que les coûts de calcul de référence augmentent : Nvidia a indiqué à de grands clients du cloud que les prix des serveurs IA pour livraison en 2027 augmenteraient de plus de 15 pour cent, tirés par le coût de la mémoire, ce qui renchérit le choix par défaut du plus grand modèle disponible pour chaque tâche.
Ce que cela signifie pour les acheteurs d'IA
L'essentiel : un agent spécialisé, une fraction de la taille d'un modèle de référence, qui le bat sur une tâche bien définie, prouve que la taille du modèle n'est pas le seul levier que les entreprises européennes et britanniques devraient actionner pour budgétiser leurs capacités en IA.
Les équipes achats et techniques qui évaluent des fournisseurs d'IA pour une tâche précise et bien définie, de la revue de documents à la migration de code en passant par le soutien à la recherche, ont désormais une raison concrète de tester des modèles plus petits et entraînés à cet effet face aux modèles généraux de référence avant de s'engager vers l'option plus grande et plus coûteuse. Les laboratoires de référence restent en tête sur le raisonnement général et large ; l'affirmation ici est plus étroite et spécifique à la tâche, pas une affirmation que Faraday remplace Claude ou GPT-5.5 dans l'absolu.
Ce qu'il faut retenir
Qu'un laboratoire britannique batte deux laboratoires de référence américains bien financés sur une tâche scientifique précise, six mois après sa fondation, est un signal réel en faveur de la compétitivité européenne en IA, et un rappel que la course au calcul n'est pas la seule qui compte.
À lire ensuite: Les téléchargements de Qwen cachent un vide juridique | Alibaba a tu le chiffre qui fixe votre coût



