Un Test Qu'Aucun Des Deux Camps Ne Pouvait Lire

Le 27 août 2026, Google DeepMind a mené ce que l'entreprise appelle la première évaluation en double aveugle au monde d'un modèle d'IA de pointe propriétaire, dans laquelle aucun des deux camps ne pouvait voir le matériel le plus sensible de l'autre. L'évaluation a utilisé Confidential Space, une partie du portefeuille de calcul confidentiel de Google Cloud, pour exécuter le test à l'intérieur d'une enclave cryptographique vérifiée: les questions de l'évaluateur sont restées chiffrées et hors de portée de Google, et les poids du modèle de Google sont restés chiffrés et hors de portée de l'évaluateur.

"En utilisant Confidential Space au sein du portefeuille de calcul confidentiel de Google Cloud, nous pouvons vérifier de manière cryptographique que les données d'évaluation externes et le modèle propriétaire restent privés pour leurs propriétaires respectifs", a écrit DeepMind dans son annonce. Quatre partenaires ont rejoint le pilote en tant qu'évaluateurs: l'Institut de sécurité de l'IA de Singapour, l'organisation à but non lucratif spécialisée dans la confidentialité OpenMined, le groupe d'assurance AVERI et l'organisme de normalisation MLCommons.

Ce dispositif élimine un compromis qui a marqué toute évaluation d'IA jusqu'à présent. Un évaluateur externe doit soit faire confiance aux scores autodéclarés d'un laboratoire, soit le laboratoire doit remettre les poids du modèle qu'il traite comme son principal secret commercial, soit l'évaluateur doit remettre ses questions de test en risquant que le modèle se contente de mémoriser les réponses pour la prochaine fois. Ce pilote est le premier cas public d'un modèle d'IA de pointe propriétaire passant un vrai test sans qu'aucun des deux camps n'ait à faire ce compromis.

Pourquoi Les Scores De Référence Ont Été Faciles À Manipuler

Le problème que ce pilote cherche à résoudre porte un nom: la contamination des référentiels, la situation où un modèle a déjà été exposé, directement ou indirectement, aux questions sur lesquelles il est ensuite noté. Quand cela se produit, un référentiel cesse de mesurer ce qu'un modèle sait réellement faire et commence à mesurer ce qu'il a déjà mémorisé.

L'ampleur du problème n'est pas négligeable. Des recherches antérieures citées dans la couverture du pilote ont trouvé des signes de contamination des référentiels chez environ la moitié de 31 modèles d'IA testés, la contamination gonflant davantage les scores des grands modèles que ceux des petits. Cela compte parce que les scores de référence ne sont pas seulement du texte marketing; les laboratoires les utilisent aussi comme preuve de leurs affirmations de sécurité, et régulateurs comme acheteurs d'entreprise les traitent de plus en plus comme des signaux de conformité plutôt que de les regarder avec un vrai scepticisme.

Le Modèle Testé N'Est Pas Celui Qui Compte Le Plus

Gemini Flash Lite, le modèle que DeepMind a soumis à ce pilote, occupe le niveau le plus petit et le moins cher de la famille Gemini, pas le modèle phare de pointe dont les affirmations de capacité et de sécurité portent le plus de poids commercial et réglementaire. Tester d'abord un modèle léger est une façon raisonnable d'éprouver la nouvelle plomberie technique, mais cela signifie aussi que le pilote n'a pas encore répondu à la question qui compte le plus: si la même vérification cryptographique fonctionne, et est réellement appliquée, sur le modèle que Google vend vraiment comme son système de pointe.

Les quatre partenaires évaluateurs ont été choisis par Google lui-même, et l'Institut de sécurité de l'IA de Singapour est un véritable organisme de sécurité étatique, ce qui confère au pilote une réelle indépendance. Mais aucun auditeur externe n'a encore vérifié l'intégrité de l'enclave elle-même, et DeepMind l'a décrit comme un pilote, pas comme un engagement permanent à tester ainsi chaque modèle à l'avenir.

Ce Que Cela Signifie Pour Les Acheteurs Et Régulateurs D'IA Dans L'UE Et Au Royaume-Uni

Pour une organisation de l'UE ou du Royaume-Uni qui achète ou régule des systèmes d'IA, la question intéressante n'est pas de savoir si ce pilote précis a fonctionné, mais si l'évaluation en double aveugle devient la preuve standard que les fournisseurs devront produire. Vérifier de manière indépendante les affirmations de sécurité d'un modèle de pointe signifie aujourd'hui généralement l'une de deux options peu satisfaisantes: faire confiance à la fiche de modèle publiée par le fournisseur lui-même, ou exiger un accès aux poids que presque aucun laboratoire n'accordera.

Ce pilote est une réponse technique fonctionnelle à cette lacune, pas encore une obligation légale où que ce soit, et pas encore appliquée à un modèle dont les affirmations guident réellement les décisions d'achat ou les dépôts réglementaires. Un acheteur de l'UE ou du Royaume-Uni évaluant un fournisseur d'IA de pointe pour des preuves de conformité a une nouvelle question concrète à poser: acceptera-t-il de soumettre son modèle phare, pas seulement son niveau le moins cher, à une évaluation comme celle-ci.