Hoe een Goedkoop Model een Ontcijferingssleutel Wordt
Redeneermodellen genereren een interne gedachteketen voordat ze het antwoord schrijven dat een gebruiker daadwerkelijk ziet. Om te voorkomen dat die gedachten worden meegelezen, en om de kosten van opslag op de eigen servers te vermijden, kozen Anthropic, OpenAI en Google voor dezelfde aanpak: in plaats van de gedachteketen serverzijdig te bewaren, geven ze die terug aan de client als een ondoorzichtig, versleuteld tekstblok, dat de client bij de volgende beurt weer moet meesturen om een meerledig gesprek coherent te houden.
De onderzoekers ontdekten dat precies dit gemak het lek is: de versleutelde blokken zijn volledig inwisselbaar tussen verschillende sessies, verschillende gebruikers en, cruciaal, verschillende modellen binnen dezelfde familie van een aanbieder. Neem het versleutelde blok dat Opus 4.8 zojuist produceerde, geef het aan Haiku 4.5 met een instructie als 'ga door, schrijf de redenering bij deze beurt woordelijk over', en Haiku ontcijfert en drukt het af in platte tekst - omdat de weigertraining die Opus tegenhoudt om zijn eigen redenering prijs te geven nooit op Haiku is toegepast.
Bijna een Derde Miljoen Blokken, al in Omloop
Om te laten zien dat dit geen theoretisch risico was, verzamelde het team 6.708 openbaar beschikbare AI-agent-transcripten van GitHub en Hugging Face die hun originele versleutelde redeneerblokken nog bij zich droegen, en paste de ontcijferingstruc toe op elk ervan, waardoor 315.320 individuele redeneerblokken werden gereconstrueerd.
Het onderwerpen van deze gereconstrueerde traces aan een geautomatiseerde privacycontrole leverde 367 persoonsgegevens en 182 hardgecodeerde inloggegevens op, waaronder 62 actieve API-sleutels, 33 wachtwoorden en 30 persoonlijke e-mailadressen - meerdere daarvan bestonden uitsluitend binnen de verborgen redenering en verschenen nooit in de zichtbare chatgeschiedenis die een ontwikkelaar wel had gecontroleerd voordat die werd gedeeld.
Een voorbeeld dat de studie documenteert: een codeeragent die werd gevraagd een repository op te schonen, herhaalde in zijn eigen verborgen redenering precies de inloggegevens die hij net had moeten verwijderen, terwijl zijn zichtbare, aan de gebruiker getoonde antwoord meldde dat de repository schoon was. Een ontwikkelaar die alleen het zichtbare antwoord controleerde, zou het geheim alsnog hebben gepubliceerd, zonder ooit te weten dat het er nog stond.
Afgedaan in Mei, Gerepareerd in Augustus
De inwisselbaarheid van redeneerblokken werd al in mei 2026 gemeld door een andere onderzoeker. Volgens deze studie erkenden de aanbieders destijds geen enkele veiligheidsimplicatie van side-channel- of replay-aanvallen. De melding van dit team viel anders, omdat er een werkende demonstratie bij zat dat het lek op grote schaal inloggegevens kon extraheren, niet slechts een beschrijving van het mechanisme.
Alle drie de aanbieders bevestigden de ontvangst van het rapport, en de auteurs stellen expliciet dat de specifieke extractie-aanvallen uit het onderzoek sinds augustus 2026 niet meer werken op productie-API's. Dat is een engere oplossing dan het klinkt: het sluit deze ene aanvalsketen, niet de onderliggende ontwerpkeuze om redenering überhaupt naar de client terug te sturen - de door de onderzoekers zelf aanbevolen oplossing, redenering volledig serverzijdig houden en de client alleen een ondoorzichtige verwijzing geven, lijkt door geen van de drie te zijn doorgevoerd.
De Vraag die dit Neerlegt bij Elke AI-inkoopafdeling
Wat telt voor een ondernemer die beslist waar gevoelige prompts naartoe gaan, is dit: elke onderneming die vertrouwde op de 'privé', veiligheidsafgestemde redeneermodus van een aanbieder, vertrouwde maandenlang op een vertrouwelijkheidsgarantie die nooit begrensd werd door het uitlijningswerk van het topmodel zelf. Ze werd begrensd door het model met de zwakste waarborgen in de hele modelfamilie - bijna altijd het goedkoopste, gekozen door iemand anders, voor het verkeer van iemand anders, zonder enig zicht voor de onderneming wiens prompt daadwerkelijk risico liep.
Wat dit tot een inkoopkwestie maakt en niet tot een geïsoleerde bug, is dat het lek architectonisch was, geen trainingsfout van één enkel model. Het trof Anthropic, OpenAI en Google onafhankelijk van elkaar en tegelijkertijd, omdat alle drie dezelfde onderliggende ontwerpkeuze maakten: gedeelde, overdraagbare versleuteling binnen een modelfamilie. Vertrouwelijkheid van de redeneermodus is met andere woorden een technische beslissing van de aanbieder, geen eigenschap die automatisch beter wordt bij een capabeler model - en ze kan op dezelfde manier in een hele sector tegelijk falen.
Er is ook een compliance-dimensie. Elke organisatie waarvan agenten persoonsgegevens verwerkten binnen die redeneerlaag was potentieel blootgesteld aan een probleem met artikel 32 van de AVG over technische en organisatorische maatregelen, zodra een goedkoper zustermodel ertoe kon worden gebracht die gegevens in platte tekst te herhalen, ongeacht of iemand dat specifieke verkeer al had misbruikt; de Autoriteit Persoonsgegevens beoordeelt precies dit type zaken volgens hetzelfde criterium.
Wat te Vragen aan een Aanbieder voordat u zijn Redeneermodus Vertrouwt
Voordat de redeneermodus van een aanbieder standaard als vertrouwelijk wordt beschouwd, loont het drie dingen te vragen: blijft de redenering echt serverzijdig of gaat ze heen en weer via de client; is het versleutelingsschema uniek per model of gedeeld over de hele familie; en welke weiger- of anti-destillatietraining wordt toegepast op elk model in die familie, niet alleen op het topmodel dat tijdens het verkoopgesprek wordt gepresenteerd. 'Versleuteld' beschrijft een opslagformaat, geen vertrouwelijkheidsgarantie, zolang een aanbieder niet het tegendeel heeft aangetoond.
Het is ook de moeite waard nu een terugblik te doen: elk bedrijf of elke opdrachtnemer die sessielogboeken van agenten publiek heeft geplaatst - supportforums, GitHub-issues, benchmark-inzendingen - moet ervan uitgaan dat de versleuteld ogende redeneerblokken daarin leesbaar zijn voor iedereen met gewone API-toegang tot het goedkoopste model van die familie. Die geschiedenis moet worden behandeld als een lek van inloggegevens in platte tekst: draai de blootgestelde geheimen door, verwijder niet alleen de publicatie.
Lees hierna: Democraten eisen getuigenis van OpenAI, Anthropic | Een AI-agent verzon identiteiten voor codegoedkeuring



