Ett Test Som Ingen Av Sidorna Kunde Läsa

Den 27 augusti 2026 genomförde Google DeepMind det företaget kallar världens första dubbelblinda utvärdering av en proprietär toppmodell inom AI, där ingen av de två parterna kunde se den andras mest känsliga material. Utvärderingen använde Confidential Space, en del av Google Clouds Confidential Computing-portfölj, för att köra testet inuti en verifierad kryptografisk enklav: utvärderarens testfrågor förblev krypterade och otillgängliga för Google, och Googles modellvikter förblev krypterade och otillgängliga för utvärderaren.

"Genom att använda Confidential Space inom Google Clouds Confidential Computing-portfölj kan vi kryptografiskt verifiera att både den externa utvärderingsdatan och den proprietära modellen förblir privata för sina respektive ägare", skrev DeepMind i sitt tillkännagivande. Fyra partner gick med i pilotprojektet som utvärderare: Singapores AI Safety Institute, integritetsteknik-organisationen OpenMined, garantigruppen AVERI och standardiseringsorganet MLCommons.

Det upplägget eliminerar en avvägning som hittills har präglat all AI-utvärdering. En extern utvärderare måste antingen lita på ett labbs självrapporterade poäng, eller så måste labbet lämna ut modellvikter som det behandlar som sin viktigaste affärshemlighet, eller så måste utvärderaren lämna ut sina testfrågor och riskera att modellen helt enkelt memorerar svaren till nästa gång. Det här pilotprojektet är det första offentliga fallet där en proprietär toppmodell klarar ett riktigt test utan att någon av parterna behöver göra den avvägningen.

Varför Benchmarkpoäng Har Varit Lätta Att Manipulera

Problemet det här pilotprojektet ska lösa har ett namn: benchmarkkontaminering, situationen där en modell redan direkt eller indirekt har exponerats för de frågor den senare bedöms utifrån. När det händer slutar ett benchmark mäta vad en modell faktiskt kan och börjar istället mäta vad den redan har memorerat.

Problemets omfattning är inte liten. Tidigare forskning, citerad i rapporteringen om pilotprojektet, fann tecken på benchmarkkontaminering hos ungefär hälften av 31 testade AI-modeller, där kontamineringen blåste upp poängen mer för större modeller än för mindre. Det spelar roll eftersom benchmarkpoäng inte bara är marknadsföringstext; labb använder dem också som bevis för säkerhetspåståenden, och tillsynsmyndigheter och företagsköpare behandlar dem alltmer som ett compliance-signal istället för att granska dem med verklig skepsis.

Modellen Som Testades Är Inte Den Som Betyder Mest

Gemini Flash Lite, modellen DeepMind körde genom det här pilotprojektet, ligger på den minsta och billigaste nivån i Gemini-familjen, inte det toppmodellen vars kapacitets- och säkerhetspåståenden bär störst kommersiell och regulatorisk tyngd. Att testa en lättviktsmodell först är ett rimligt sätt att pröva den nya tekniska grunden, men det betyder också att pilotprojektet ännu inte har besvarat den viktigaste frågan: om samma kryptografiska kontroll fungerar, och faktiskt körs, på den modell Google verkligen säljer som sitt toppsystem.

De fyra utvärderingspartnerna valdes av Google självt, och Singapores AI Safety Institute är ett äkta statligt säkerhetsorgan, vilket ger pilotprojektet en viss verklig oberoende ställning. Men ingen extern granskare har ännu verifierat själva enklavens integritet, och DeepMind har beskrivit det som ett pilotprojekt, inte som ett permanent åtagande att testa varje modell på det här sättet framöver.

Vad Det Betyder För AI-Köpare Och Tillsynsmyndigheter I EU Och Storbritannien

För en organisation i EU eller Storbritannien som köper eller reglerar AI-system är den intressanta frågan inte om just det här pilotprojektet fungerade, utan om dubbelblind utvärdering blir det standardbevis leverantörer förväntas leverera. Att oberoende verifiera en toppmodells säkerhetspåståenden betyder idag oftast ett av två otillfredsställande alternativ: lita på leverantörens egen publicerade modellbeskrivning, eller kräva tillgång till vikterna som nästan inget labb kommer att bevilja.

Det här pilotprojektet är ett fungerande tekniskt svar på den luckan, ännu inget lagkrav någonstans, och ännu inte tillämpat på en modell vars påståenden faktiskt styr inköpsbeslut eller regulatoriska ansökningar. En köpare i EU eller Storbritannien som utvärderar en toppmodell-leverantör för compliance-bevis har en konkret ny fråga att ställa: om leverantören är villig att skicka sin flaggskeppsmodell, inte bara sin billigaste nivå, genom en utvärdering som den här.