Een Test Die Geen Van Beide Kanten Kon Lezen
Op 27 augustus 2026 voerde Google DeepMind uit wat het bedrijf de eerste dubbelblinde evaluatie ter wereld noemt van een propriëtair, toonaangevend AI-model, waarbij geen van beide partijen het meest gevoelige materiaal van de ander kon zien. De evaluatie gebruikte Confidential Space, onderdeel van het Confidential Computing-aanbod van Google Cloud, om de test uit te voeren binnen een geverifieerde cryptografische enclave: de testvragen van de beoordelaar bleven versleuteld en buiten bereik van Google, en de modelgewichten van Google bleven versleuteld en buiten bereik van de beoordelaar.
"Door Confidential Space te gebruiken binnen het Confidential Computing-portfolio van Google Cloud, kunnen we cryptografisch verifiëren dat zowel de externe evaluatiedata als het propriëtaire model privé blijven voor hun respectieve eigenaars", schreef DeepMind in zijn aankondiging. Vier partners sloten zich aan als beoordelaars: het Singaporese AI Safety Institute, de non-profitorganisatie voor privacytechnologie OpenMined, de toetsingsgroep AVERI en de standaardisatie-instantie MLCommons.
Die opzet elimineert een afweging die tot nu toe elke AI-evaluatie heeft bepaald. Een externe beoordelaar moet ofwel vertrouwen op de zelfgerapporteerde scores van een lab, of het lab moet modelgewichten overhandigen die het als zijn belangrijkste bedrijfsgeheim behandelt, of de beoordelaar moet zijn testvragen overhandigen en het risico lopen dat het model de antwoorden simpelweg onthoudt voor de volgende keer. Dit pilotproject is het eerste openbare geval waarin een propriëtair topmodel een echte test doorstaat zonder dat een van beide partijen die afweging hoeft te maken.
Waarom Benchmarkscores Tot Nu Toe Makkelijk Te Manipuleren Waren
Het probleem dat dit pilotproject wil oplossen heeft een naam: benchmarkbesmetting, de situatie waarin een model al direct of indirect is blootgesteld aan de vragen waarop het later wordt beoordeeld. Wanneer dat gebeurt, meet een benchmark niet langer wat een model werkelijk kan, maar wat het al heeft onthouden.
De omvang van het probleem is niet klein. Eerder onderzoek, aangehaald in de berichtgeving over het pilotproject, vond tekenen van benchmarkbesmetting bij ongeveer de helft van 31 geteste AI-modellen, waarbij besmetting de scores van grotere modellen sterker opblies dan die van kleinere. Dat is relevant omdat benchmarkscores niet alleen marketingtekst zijn; labs gebruiken ze ook als bewijs voor veiligheidsclaims, en toezichthouders en zakelijke kopers behandelen ze steeds vaker als compliancesignaal in plaats van ze met echte scepsis te bekijken.
Het Geteste Model Is Niet Het Model Dat Er Het Meest Toe Doet
Gemini Flash Lite, het model dat DeepMind door dit pilotproject stuurde, valt in het kleinste en goedkoopste segment van de Gemini-familie, niet het topmodel wiens capaciteits- en veiligheidsclaims het meeste commerciële en regulatoire gewicht dragen. Eerst een lichtgewicht model testen is een redelijke manier om de nieuwe technische basis te bewijzen, maar het betekent ook dat het pilotproject de belangrijkste vraag nog niet heeft beantwoord: of dezelfde cryptografische controle werkt, en daadwerkelijk wordt uitgevoerd, op het model dat Google echt als zijn topsysteem verkoopt.
De vier beoordelingspartners werden door Google zelf gekozen, en het Singaporese AI Safety Institute is een echte statelijke veiligheidsinstantie, wat het pilotproject enige echte onafhankelijkheid geeft. Maar geen enkele externe auditor heeft nog de integriteit van de enclave zelf geverifieerd, en DeepMind heeft dit omschreven als een pilotproject, niet als een blijvende toezegging om elk model voortaan zo te testen.
Wat Dit Betekent Voor AI-Kopers En Toezichthouders In De EU En Het Verenigd Koninkrijk
Voor een organisatie in de EU of het Verenigd Koninkrijk die AI-systemen koopt of reguleert, is de interessante vraag niet of dit specifieke pilotproject werkte, maar of dubbelblinde evaluatie het standaardbewijs wordt dat leveranciers moeten leveren. Onafhankelijke verificatie van de veiligheidsclaims van een topmodel betekent vandaag meestal een van twee onbevredigende opties: vertrouwen op de eigen gepubliceerde modelkaart van de leverancier, of toegang tot de gewichten eisen die bijna geen enkel lab zal geven.
Dit pilotproject is een werkend technisch antwoord op die leemte, nog geen wettelijke eis waar dan ook, en nog niet toegepast op een model wiens claims daadwerkelijk inkoopbeslissingen of regelgevende indieningen sturen. Een koper in de EU of het Verenigd Koninkrijk die een leverancier van topmodellen beoordeelt op compliancebewijs heeft een concrete nieuwe vraag te stellen: of die bereid is zijn vlaggenschipmodel, niet alleen zijn goedkoopste segment, aan zo'n evaluatie te onderwerpen.
Lees hierna: Qwens downloadrecord verhult een EU-nalevingsgat | Anthropics wellbeing-beurzen herhalen OpenAIs gat



