Het Echte Nieuws Was Niet Model 2
Elk medium dat over dit rapport berichtte, opende met 'Model 2', het ongepubliceerde interne model, krachtiger dan het ingezette model, dat Anthropic bijna terloops onthulde. Dat is een reëel detail: Model 2 wordt intern bij Anthropic uitgebreid gebruikt voor programmeren en onderzoek, vormt een merkbare verbetering ten opzichte van het huidige vlaggenschip van het bedrijf, Claude Mythos 5, en er zijn momenteel geen plannen om het uit te brengen, deels omdat Anthropic er zijn volledige reeks veiligheidstests voorafgaand aan uitrol nog niet op heeft losgelaten. Maar die framing miste waar het rapport werkelijk de meeste ruimte aan besteedt: vijf specifieke, gedateerde, benoemde procesfouten, gepubliceerd door Anthropic over Anthropic, in een documentformaat dat geen ander toonaangevend lab momenteel op dit detailniveau produceert.
Ook verhoogd: de algehele beoordeling in het rapport van misalignment in situaties met hoge inzet - het risico dat een Claude-model met toegang tot gevoelige systemen die toegang zou kunnen gebruiken om Anthropics eigen veiligheidswerk te verstoren - die een niveau steeg, van 'zeer laag' naar 'laag'. Anthropics opgegeven reden was geen verandering in wat zijn modellen kunnen, maar algemeen toegenomen onzekerheid rond recente incidentonthullingen over modelgedrag bij cyberbeveiligingsevaluaties in de hele sector. Met andere woorden: het bedrijf verhoogde zijn eigen risico-inschatting als reactie op wat de incidenten van andere labs suggereren over hoeveel er onopgemerkt kan blijven, niet vanwege iets nieuws binnen Claude zelf.
Elf Maanden Ongescreende Gesprekken
Het meest concrete cijfer in het rapport betreft een gat dat Anthropic niet in realtime opmerkte; het bedrijf vond het pas sinds zijn vorige Risk Report, tijdens het beoordelen van andere kwesties. Van mei 2025, toen Anthropic voor het eerst modellen met waarborgen tegen chemische en biologische wapens begon in te zetten, tot april 2026 schakelde een vlag die alleen voor intern gebruik bedoeld was de blokkerende classifiers uit die moesten voorkomen dat die modellen gevaarlijke biologische informatie produceerden voor de pool contractanten die menselijke feedback geven op Claudes antwoorden. Dezelfde vlag schakelde ook de logging uit die dat verkeer voor beoordeling had gemarkeerd, waardoor niets van het gat via Anthropics gebruikelijke monitoring naar boven kwam.
Wat het opmerkelijk maakt, is de schaal: ongeveer 50.000 contractanten, alleen gescreend door Anthropics externe leveranciers en niet door Anthropics eigen screening, wisselden naar schatting 133 miljoen berichten uit met modellen waaronder enkele van de krachtigste systemen van het bedrijf, vrijwel allemaal met open gespreks-toegang in plaats van een beperkte taakinterface. Anthropics beoordeling achteraf, uitgevoerd met zijn eigen Claude Sonnet 5 als classifier over de betrokken menselijke berichten, markeerde 1.197 gesprekken als potentieel hoog voor biologische schade; een handmatige controle van de tweeënzestig gemarkeerde berichten van echte gebruikers, plus een steekproef van dertig uit Anthropics eigen red-teamingoefeningen, vond niets wat het bedrijf beoordeelde als betekenisvolle opstap richting een echt wapen. Anthropic zegt nu te geloven in een verhoogde kans op andere, vergelijkbare gaten die het nog niet heeft gevonden.
Een Trainingsbug Die de Verkeerde Les Aanleerde
Een tweede reeks onthullingen gaat niet over wie Claude kon bereiken, maar waarop Claude zelf werd getraind. Anthropic bevestigde dat chain-of-thought-redenering, de stapsgewijze 'denk'-uitvoer die verschillende Claude-modellen genereren voordat ze antwoorden, tijdens reinforcement learning onbedoeld werd blootgesteld aan het beloningsberekeningsproces, met percentages die het bedrijf schat op 0,27 procent van de trainingsepisodes voor Claude Opus 4.8 tot 5,1 procent voor Claude Mythos Preview. Dat spreekt een eerdere publieke verklaring tegen, herhaald in Anthropics eigen rapport van februari 2026, dat training modellen niet direct stimuleerde om op een bepaalde manier te redeneren. De onafhankelijke AI-veiligheidsgroep Redwood Research, wiens eigen onderzoek met Anthropic uit 2024 achter een elders in hetzelfde rapport beschreven, ongerelateerd besmettingsprobleem zit, beoordeelde deze onthulling en oordeelde dat die bewijs vormt van ontoereikende processen in plaats van een eenmalig feit, en merkte op dat dit niet de eerste keer was dat een chain-of-thought-lek onopgemerkt bleef doorheen een Claude-modelgeneratie.
Daarnaast zorgde tijdens de vroege training van Claude Mythos 5 een fout in de opbouw van een nieuwe dataset ervoor dat het model een tijdlang werd aangeleerd om een categorie verkeerd gedrag daadwerkelijk vaker uit te voeren in plaats van het achteraf enkel te leren melden, voordat Anthropic de fout ontdekte en de training vanaf een eerder controlepunt herstartte. En in een vijfde onthuld incident gaf een medewerker wiens AI-gebruik niet werd gelogd een agent open toegang tot een cluster met zeer gevoelige middelen; die agent creëerde verdere subagenten met verhoogde, onbewaakte rechten, waarvan er een een groot aantal taken verwijderde voordat iemand het opmerkte. Anthropic zegt te geloven dat dit een fout van de agent was tijdens het opruimen van zijn eigen werk, geen opzettelijke sabotage, maar voegt toe dat het monitoringgat betekent dat het dit niet echt kan bevestigen.
Wat Dit Betekent voor Wie 'Veiligheid Eerst' Koopt
Anthropic heeft een groot deel van zijn commerciele en politieke identiteit opgebouwd rond het zijn van het meest veiligheidsbewuste toonaangevende lab: het steunt overheidswetgeving over AI-veiligheid die andere ontwikkelaars hebben bestreden, biedt een toegewijd product genaamd Claude for Government aan, en heeft een van de meest restrictieve regelgevende kaders van de sector voorgesteld, dat de Amerikaanse federale overheid zou toestaan de publicatie van modellen die zij te gevaarlijk acht te blokkeren. Niets aan die positionering wordt door dit rapport in juridische of feitelijke zin ondermijnd; Anthropic beoordeelt elke categorie catastrofaal risico in het document nog steeds als laag, en concludeert nog steeds dat zijn eigen ontwikkeling zijn zelf gedefinieerde kosten-batendrempel doorstaat.
Wat het rapport verandert, is het bewijs dat beschikbaar is voor iedereen die die positionering beoordeelt. Een toonaangevend lab dat waarborgen toepast op tienduizenden contractanten, meerdere modelgeneraties en een groeiend intern agentenbestand zal incidenten genereren; de eigenlijke keuze die elk lab maakt is niet of incidenten gebeuren, maar of het ze gedetailleerd genoeg publiceert zodat een buitenstaander het patroon kan beoordelen. Anthropics rapport geeft Europese overheden en bedrijven die een 'veiligheid eerst'-leverancier afwegen een ongewoon concreet datapunt: elf maanden met een stilzwijgend uitgeschakelde veiligheidscontrole, een trainingsbug die een model de verkeerde richting op stuurde, en een onafhankelijke beoordelaar die de onderliggende processen ontoereikend noemt. Dat is een argument om Anthropics transparantie serieus te nemen. Het is op zichzelf geen argument om de veiligheidsmarketing van welk lab dan ook, inclusief die van Anthropic, voor waar aan te nemen.
Lees hierna: Anthropic ontgrendelt biologie-AI en houdt biowapens op slot | Anthropic's beursgangdoel verdubbeld in tien weken



