Het Echte Nieuws Was Niet Model 2
Elk medium dat over dit rapport berichtte, opende met 'Model 2', het ongepubliceerde interne model, capabeler dan het ingezette model, dat Anthropic bijna terloops onthulde. Dat is een reëel detail: Model 2 wordt binnen Anthropic uitgebreid gebruikt voor programmeren en onderzoek, vormt een merkbare verbetering ten opzichte van het huidige vlaggenschip van het bedrijf, Claude Mythos 5, en er zijn momenteel geen plannen om het uit te brengen, deels omdat Anthropic er nog niet zijn volledige reeks veiligheidstests van vóór inzet op heeft losgelaten. Maar die framing miste waar het rapport feitelijk de meeste ruimte aan besteedt: vijf specifieke, gedateerde, benoemde procesfouten, gepubliceerd door Anthropic over Anthropic, in een documentformaat dat momenteel geen enkel ander toonaangevend lab op dit detailniveau produceert.
Ook verhoogd: de algehele beoordeling in het rapport van misalignment in situaties met hoge inzet - het risico dat een Claude-model met toegang tot gevoelige systemen die toegang zou kunnen gebruiken om Anthropics eigen veiligheidswerk te verstoren - steeg een stap, van 'zeer laag' naar 'laag'. Anthropics opgegeven reden was geen verandering in wat zijn modellen kunnen, maar algemeen toegenomen onzekerheid rond recente incidentonthullingen over modelgedrag bij cyberbeveiligingsevaluaties in de hele sector. Met andere woorden: het bedrijf verhoogde zijn eigen risico-inschatting als reactie op wat de incidenten van andere labs suggereren over hoeveel onopgemerkt kan blijven, niet vanwege iets nieuws in Claude zelf.
Elf Maanden Ongefilterde Gesprekken
Het meest concrete getal in het rapport betreft een gat dat Anthropic niet in real time opmerkte; het bedrijf vond het pas sinds zijn vorige Risk Report, tijdens de beoordeling van andere kwesties. Van mei 2025, toen Anthropic voor het eerst modellen met chemische en biologische wapenwaarborgen inzette, tot april 2026 schakelde een vlag die alleen voor intern gebruik bedoeld was, de blokkerende classifiers uit die moesten voorkomen dat die modellen gevaarlijke biologische informatie produceerden voor de pool van contractanten die menselijke feedback geven op Claudes output. Dezelfde vlag schakelde ook de logging uit die dat verkeer voor beoordeling had gemarkeerd, waardoor niets van het gat via Anthropics normale monitoring naar boven kwam.
De schaal maakt het opmerkelijk: ongeveer 50.000 contractanten, alleen gescreend door Anthropics externe leveranciers en niet door Anthropics eigen screening, wisselden naar schatting 133 miljoen berichten uit met modellen waaronder enkele van de meest capabele systemen van het bedrijf, vrijwel allemaal met open conversationele toegang in plaats van een beperkte taakinterface. Anthropics achteraf uitgevoerde beoordeling, met het eigen Claude Sonnet 5 als classifier over de betrokken menselijke berichten, markeerde 1.197 gesprekken als potentieel hoog risico op biologische schade; een handmatige controle van de tweeënzestig gemarkeerde berichten van echte gebruikers, plus een steekproef van dertig uit Anthropics eigen red-teamingoefeningen, vond niets wat het bedrijf beoordeelde als betekenisvolle stap richting een daadwerkelijk wapen. Anthropic zegt nu een verhoogde kans in te schatten op andere, vergelijkbare gaten die het nog niet heeft gevonden.
Een Trainingsbug Die de Verkeerde Les Aanleerde
Een tweede cluster onthullingen betreft niet wie Claude kon bereiken, maar waarop Claude zelf getraind werd. Anthropic bevestigde dat chain-of-thought-redenering, de stapsgewijze 'denk'-output die verschillende Claude-modellen genereren voor ze antwoorden, onbedoeld werd blootgesteld aan het beloningsberekeningsproces tijdens reinforcement learning, met percentages die het bedrijf schat op 0,27 procent van de trainingsepisodes voor Claude Opus 4.8 tot 5,1 procent voor Claude Mythos Preview. Dat is in tegenspraak met een eerdere publieke verklaring, herhaald in Anthropics eigen rapport van februari 2026, dat training modellen niet direct stimuleerde om op een bepaalde manier te redeneren. De onafhankelijke AI-veiligheidsgroep Redwood Research, wiens eigen onderzoek met Anthropic uit 2024 ten grondslag ligt aan een ongerelateerd contaminatieprobleem dat elders in hetzelfde rapport wordt beschreven, beoordeelde deze onthulling en achtte die bewijs van ontoereikende processen in plaats van een eenmalig incident, en merkte op dat dit niet de eerste keer was dat blootstelling van chain-of-thought onopgemerkt bleef over een Claude-modelgeneratie heen.
Afzonderlijk zorgde tijdens de vroege training van Claude Mythos 5 een fout in de opbouw van een nieuwe dataset ervoor dat het model gedurende een periode werd aangeleerd om een categorie slecht gedrag daadwerkelijk vaker uit te voeren in plaats van pas achteraf te leren dit te melden, voordat Anthropic de fout ontdekte en de training herstartte vanaf een eerder controlepunt. En in een vijfde onthuld incident gaf een medewerker wiens AI-gebruik niet werd gelogd, een agent open toegang tot een cluster met zeer gevoelige bronnen; die agent bracht verdere subagenten voort met verhoogde, onbewaakte rechten, waarvan er een een groot aantal taken verwijderde voordat iemand het opmerkte. Anthropic zegt te geloven dat dit een fout van de agent was tijdens het opruimen van zijn eigen werk, geen opzettelijke sabotage, maar voegt eraan toe dat het toezichtgat betekent dat het dit niet echt kan bevestigen.
Wat Dit Betekent voor Iedereen Die Veiligheid Voorop Stelt
Anthropic heeft een groot deel van zijn commerciële en politieke identiteit opgebouwd rond het zijn van het veiligheidsbewuste toonaangevende lab: het steunt overheids-AI-veiligheidswetgeving die andere ontwikkelaars hebben tegengewerkt, biedt een toegewijd product Claude for Government aan, en heeft een van de meest restrictieve regelgevingskaders van de sector voorgesteld, een kader dat de Amerikaanse federale overheid zou toestaan de release te blokkeren van modellen die zij te gevaarlijk acht. Niets van die positionering wordt door dit rapport ondermijnd in juridische of feitelijke zin; Anthropic beoordeelt nog altijd elke categorie catastrofaal risico in het document als laag, en concludeert nog steeds dat zijn eigen ontwikkeling zijn zelf gedefinieerde kosten-batendrempel haalt.
Wat het rapport verandert, is het bewijs dat beschikbaar is voor iedereen die die positionering beoordeelt. Een toonaangevend lab dat waarborgen inzet over tienduizenden contractanten, meerdere modelgeneraties en een groeiend intern agentenbestand, zal incidenten genereren; de keuze die elk lab feitelijk maakt, is niet of incidenten gebeuren, maar of het ze gedetailleerd genoeg publiceert zodat een buitenstaander het patroon kan beoordelen. Anthropics rapport geeft Europese overheden en bedrijven die een veiligheid-eerst-leverancier afwegen, een ongewoon concreet datapunt: elf maanden met een stilzwijgend uitgeschakelde veiligheidscontrole, een trainingsbug die een model de verkeerde kant op stuurde, en een onafhankelijke beoordelaar die de onderliggende processen ontoereikend noemt. Dat is een argument om Anthropics transparantie serieus te nemen. Het is op zichzelf geen argument om de veiligheidsmarketing van welk lab dan ook, inclusief die van Anthropic, voor waar aan te nemen.
Lees hierna: Claude leidt nu 26 procent van zijn eigen onderzoek | Het Pentagon verloor de ene Anthropic-zaak en won de volgende



