En Test Som Ingen Af Parterne Kunne Læse
Den 27. august 2026 gennemførte Google DeepMind det, virksomheden kalder verdens første dobbeltblinde evaluering af en proprietær topmodel inden for AI, hvor ingen af de to parter kunne se den andens mest følsomme materiale. Evalueringen brugte Confidential Space, en del af Google Clouds Confidential Computing-portefølje, til at køre testen inde i en verificeret kryptografisk enklave: evaluatorens testspørgsmål forblev krypteret og utilgængelige for Google, og Googles modelvægte forblev krypteret og utilgængelige for evaluatoren.
"Ved at bruge Confidential Space inden for Google Clouds Confidential Computing-portefølje kan vi kryptografisk bekræfte, at både de eksterne evalueringsdata og den proprietære model forbliver private for deres respektive ejere," skrev DeepMind i sin meddelelse. Fire partnere deltog i pilotprojektet som evaluatorer: Singapores AI Safety Institute, privatlivsteknologi-organisationen OpenMined, garantigruppen AVERI og standardiseringsorganet MLCommons.
Den konstruktion fjerner et kompromis, der indtil nu har præget enhver AI-evaluering. En ekstern evaluator må enten stole på et laboratoriums selvrapporterede scorer, eller laboratoriet må udlevere modelvægte, som det behandler som sin vigtigste forretningshemmelighed, eller evaluatoren må udlevere sine testspørgsmål og risikere, at modellen blot husker svarene til næste gang. Dette pilotprojekt er det første offentlige tilfælde, hvor en proprietær topmodel består en rigtig test, uden at nogen af parterne skal indgå det kompromis.
Hvorfor Benchmark-Scorer Har Været Nemme At Manipulere
Problemet, som dette pilotprojekt skal løse, har et navn: benchmark-forurening, situationen hvor en model allerede direkte eller indirekte har været eksponeret for de spørgsmål, den senere bedømmes ud fra. Når det sker, holder et benchmark op med at måle, hvad en model faktisk kan, og begynder i stedet at måle, hvad den allerede har husket.
Problemets omfang er ikke lille. Tidligere forskning, citeret i dækningen af pilotprojektet, fandt tegn på benchmark-forurening hos omkring halvdelen af 31 testede AI-modeller, hvor forureningen opblæste scorerne mere for store modeller end for små. Det betyder noget, fordi benchmark-scorer ikke kun er marketingtekst; laboratorier bruger dem også som bevis for sikkerhedspåstande, og tilsynsmyndigheder og virksomhedskøbere behandler dem i stigende grad som et compliance-signal i stedet for at se på dem med reel skepsis.
Modellen Der Blev Testet, Er Ikke Den Der Betyder Mest
Gemini Flash Lite, modellen DeepMind sendte gennem dette pilotprojekt, ligger på det mindste og billigste niveau i Gemini-familien, ikke det topmodel, hvis kapacitets- og sikkerhedspåstande bærer den største kommercielle og regulatoriske vægt. At teste en let model først er en fornuftig måde at afprøve den nye tekniske infrastruktur på, men det betyder også, at pilotprojektet endnu ikke har besvaret det vigtigste spørgsmål: om det samme kryptografiske tjek virker, og rent faktisk bliver kørt, på den model, Google reelt sælger som sit topsystem.
De fire evaluatorpartnere blev valgt af Google selv, og Singapores AI Safety Institute er et ægte statsligt sikkerhedsorgan, hvilket giver pilotprojektet en vis reel uafhængighed. Men ingen ekstern revisor har endnu verificeret selve enklavens integritet, og DeepMind har beskrevet det som et pilotprojekt, ikke som en fast forpligtelse til at teste hver model på denne måde fremover.
Hvad Det Betyder For AI-Købere Og Tilsynsmyndigheder I EU Og Storbritannien
For en organisation i EU eller Storbritannien, der køber eller regulerer AI-systemer, er det interessante spørgsmål ikke, om dette specifikke pilotprojekt virkede, men om dobbeltblind evaluering bliver det standardbevis, leverandører fremover skal levere. At verificere en topmodels sikkerhedspåstande uafhængigt betyder i dag som regel et af to utilfredsstillende valg: at stole på leverandørens egen offentliggjorte modelbeskrivelse, eller at kræve adgang til vægtene, som næsten intet laboratorium vil give.
Dette pilotprojekt er et fungerende teknisk svar på det hul, endnu ikke et lovkrav noget sted, og endnu ikke anvendt på en model, hvis påstande faktisk styrer indkøbsbeslutninger eller myndighedsindberetninger. En køber i EU eller Storbritannien, der vurderer en topmodel-leverandør for compliance-bevis, har et konkret nyt spørgsmål at stille: om leverandøren er villig til at sende sit flagskibsprodukt, ikke bare det billigste niveau, gennem en evaluering som denne.
Læs videre: Qwens downloadrekord skjuler et EU-efterlevelseshul | Anthropics trivselslegater gentager OpenAIs hul



