Een cijfer, niet zomaar weer een waarschuwing

Op 8 september zette Anthropics eigen hoofd alignment science een concreet cijfer op het risico waar zijn werkgever elke dag aan bouwt. Evan Hubinger antwoordde een vertrekkende collega en schreef dat hij persoonlijk een kans van meer dan 10 procent ziet dat AI de mensheid in het komende decennium uitroeit.

Die collega was Jacob Coxon, een 27-jarige onderzoeker die drie jaar aan pretraining werkte, eerst bij OpenAI aan het model GPT-4o, daarna bij Anthropic. Coxon nam dinsdagavond laat ontslag en schreef dat beide labs "recht op zelfverbeterende superintelligentie afstevenen en met onze levens gokken", en voegde toe dat de bouwers van deze technologie "oprecht geloven dat het ons voor het einde van het decennium allemaal kan doden". Hubinger noemde hem correct en maakte duidelijk dat het risico waar hij op doelt specifiek voortkomt uit recursieve zelfverbetering, niet uit de commerciele modellen die Anthropic vandaag verkoopt.

Waarom een cijfer van binnenuit anders klinkt

Publieke schattingen van catastrofaal AI-risico zijn niet nieuw, externe onderzoekers en activisten publiceren al jaren enquetecijfers. Wat er op 8 september veranderde was wie er sprak: de persoon die Anthropic zelf de leiding over de alignment-wetenschap gaf, in het openbaar en met een cijfer in plaats van alleen een stemming.

Op het moment dat dit werd gemeld had Anthropic geen bedrijfsverklaring over het cijfer afgegeven, en Hubinger maakte expliciet duidelijk dat het zijn persoonlijke mening weergaf, geen officieel bedrijfsstandpunt. Dat onderscheid overleeft geen inkoopspreadsheet. Het cijfer van een met naam genoemde risico-eigenaar, hoe persoonlijk ook, is precies het soort bewijs dat een compliance-team daadwerkelijk kan vastleggen.

De compliance-invalshoek die de berichtgeving miste

Artikel 55 van de EU AI Act verplicht sinds 2 augustus 2025 aanbieders van AI-modellen voor algemene doeleinden met systeemrisico om die risico's te beoordelen en te documenteren, en sinds 2 augustus 2026, iets meer dan een maand voor Hubingers bericht, heeft het AI Bureau de formele bevoegdheid om naleving te toetsen.

De verplichtingen zijn specifiek: gestandaardiseerde modelevaluatie inclusief adversarial testing, beoordeling en beperking van systeemrisico op de hele EU-markt, melding van ernstige incidenten aan het AI Bureau, en adequate cyberbeveiliging voor het model zelf. Aanbieders wier trainingsrekenkracht de systeemrisicodrempel van de wet overschrijdt, de groep waarin toplabs zoals Anthropic vallen, zijn precies degenen voor wie dit artikel is geschreven. Een cijfer over het risico, genoemd door de persoon die het alignment-werk van die aanbieder leidt, is precies het soort voorzienbaar risico waar een toezichthouder of auditor nu naar zal zoeken.

Wat er verandert voor het team dat de tool koopt

Aan het product verandert vandaag niets. Er is geen model teruggetrokken, geen functie uitgeschakeld, en Hubingers eigen verduidelijking koppelde zijn schatting aan een toekomstig scenario, niet aan de assistent die nu de vragen van uw team beantwoordt.

Wat wel zou moeten veranderen is de documentatie. Leveranciersrisicoregisters waar nu iets staat als "AI-veiligheidszorgen, wordt gevolgd" kunnen nu een bronvermeld, gedateerd cijfer aanhalen. En elk team dat voor een kernproces afhankelijk is van een enkel toplab moet die afhankelijkheid als een met naam genoemd concentratierisico behandelen, niet als voetnoot, aangezien het cijfer van binnen de leverancier kwam en niet van een criticus van buitenaf.