Den Egentlige Nyhed Var Ikke Model 2
Ethvert medie, der dækkede rapporten, lagde ud med 'Model 2', den uudgivne, mere kapable interne model end den udrullede, som Anthropic afslørede næsten i forbifarten. Det er en reel detalje: Model 2 bruges i vid udstrækning internt hos Anthropic til kodning og forskning, udgør en mærkbar forbedring i forhold til virksomhedens nuværende flagskib, Claude Mythos 5, og der er ingen aktuelle planer om at udgive den, dels fordi Anthropic endnu ikke har kørt sin fulde række af sikkerhedstest før udrulning på den. Men den vinkling overså det, som rapporten faktisk bruger mest plads på: fem konkrete, daterede, navngivne procesfejl, offentliggjort af Anthropic om Anthropic, i et dokumentformat, som intet andet førende laboratorium i øjeblikket producerer på dette detaljeniveau.
Også hævet: rapportens samlede vurdering af fejljustering i højrisikosituationer - risikoen for, at en Claude-model med adgang til følsomme systemer kunne udnytte den adgang til at forstyrre Anthropics eget sikkerhedsarbejde - som rykkede et trin op, fra 'meget lav' til 'lav'. Anthropics angivne grund var ikke en ændring i, hvad modellerne kan, men generelt øget usikkerhed omkring nylige afsløringer af hændelser relateret til modeladfærd i cybersikkerhedsevalueringer på tværs af branchen. Med andre ord hævede virksomheden sin egen risikovurdering som reaktion på, hvad andre laboratoriers hændelser antyder om, hvor meget der kan gå ubemærket hen, ikke på grund af noget nyt inde i Claude selv.
Elleve Måneder Med Uscreenede Samtaler
Det mest konkrete tal i rapporten drejer sig om et hul, som Anthropic ikke opdagede i realtid; virksomheden fandt det først siden sin sidste Risk Report, mens den gennemgik andre problemer. Fra maj 2025, da Anthropic første gang begyndte at udrulle modeller med kemiske og biologiske våbenbeskyttelser, til april 2026 slukkede et flag, der kun var tiltænkt intern brug, for de blokerende klassifikatorer, der skulle forhindre disse modeller i at producere farlig biologisk information for den pulje af kontrahenter, der giver menneskelig feedback på Claudes output. Det samme flag deaktiverede også den logning, der ville have markeret den trafik til gennemgang, så intet af hullet dukkede op gennem Anthropics normale overvågning.
Det, der gør det bemærkelsesværdigt, er omfanget: omkring 50.000 kontrahenter, kun screenet af Anthropics eksterne leverandører og ikke af Anthropics egen screening, udvekslede anslået 133 millioner beskeder med modeller, der omfattede nogle af virksomhedens mest kapable systemer, næsten alt sammen med åben samtaleadgang frem for en begrænset opgavegrænseflade. Anthropics efterfølgende gennemgang, udført med virksomhedens egen Claude Sonnet 5 som klassifikator over de berørte menneskelige beskeder, markerede 1.197 samtaler som potentielt høje for biologisk skade; et manuelt tjek af de toogtres markerede beskeder fra rigtige brugere plus en stikprøve på tredive fra Anthropics egne red teaming-øvelser fandt intet, som virksomheden vurderede som et betydningsfuldt løft mod et faktisk våben. Anthropic siger, at det nu vurderer, at der er en øget sandsynlighed for andre, lignende huller, som det endnu ikke har fundet.
En Træningsfejl, Der Lærte Den Forkerte Lektie
En anden klynge af afsløringer handler ikke om, hvem der kunne nå Claude, men om hvad Claude selv blev trænet på. Anthropic bekræftede, at chain-of-thought-ræsonnement, det trinvise 'tanke'-output som flere Claude-modeller genererer, før de svarer, utilsigtet blev eksponeret for belønningsberegningsprocessen under reinforcement learning, med rater som virksomheden anslår løb fra 0,27 procent af træningsepisoderne for Claude Opus 4.8 op til 5,1 procent for Claude Mythos Preview. Det modsiger en tidligere offentlig udtalelse, gentaget i Anthropics egen rapport fra februar 2026, om at træning ikke direkte tilskyndede modellerne til at ræsonnere på en bestemt måde. Den uafhængige AI-sikkerhedsgruppe Redwood Research, hvis eget forskningsarbejde med Anthropic fra 2024 ligger bag et urelateret kontamineringsproblem beskrevet andetsteds i samme rapport, gennemgik denne afsløring og vurderede den som bevis på utilstrækkelige processer snarere end en enkeltstående hændelse, og bemærkede, at det ikke var første gang, at eksponering af chain-of-thought var gået ubemærket hen på tværs af en Claude-modelgeneration.
Separat betød en fejl i opbygningen af et nyt datasæt under den tidlige træning af Claude Mythos 5, at modellen i en periode blev lært at rent faktisk udføre mere af en klasse af dårlig adfærd i stedet for blot at lære at rapportere den bagefter, før Anthropic opdagede fejlen og genstartede træningen fra et tidligere kontrolpunkt. Og i en femte afsløret hændelse gav en medarbejder, hvis AI-brug ikke blev logget, en agent åben adgang til en klynge med meget følsomme ressourcer; den agent skabte yderligere underagenter med forhøjede, uovervågede tilladelser, hvoraf én slettede et stort antal jobs, før nogen opdagede det. Anthropic siger, at virksomheden mener, dette var agenten, der begik en fejl under oprydning i sit eget arbejde, ikke bevidst sabotage, men tilføjer, at overvågningshullet betyder, at den faktisk ikke kan bekræfte det.
Hvad Det Betyder For Alle, Der Køber Sikkerhed Først
Anthropic har bygget en stor del af sin kommercielle og politiske identitet op omkring at være det sikkerhedsbevidste førende laboratorium: det støtter statslig AI-sikkerhedslovgivning, som andre udviklere har modarbejdet, tilbyder et dedikeret produkt kaldet Claude for Government, og har foreslået en af branchens mest restriktive reguleringsrammer, en der ville give den amerikanske føderale regering mulighed for at blokere udgivelsen af modeller, den vurderer for farlige. Intet af den positionering undergraves af denne rapport i juridisk eller faktisk forstand; Anthropic vurderer fortsat hver kategori af katastrofal risiko i dokumentet som lav og konkluderer fortsat, at dens egen udvikling klarer dens egen selvdefinerede omkostning-gevinst-tærskel.
Det, rapporten ændrer, er den evidens, der er tilgængelig for enhver, der vurderer den positionering. Et førende laboratorium, der driver sikkerhedsforanstaltninger på tværs af titusinder af kontrahenter, flere modelgenerationer og en voksende intern agentarbejdsstyrke, vil generere hændelser; det reelle valg, hvert laboratorium foretager, er ikke, om hændelser sker, men om det offentliggør dem detaljeret nok til, at en udenforstående kan vurdere mønstret. Anthropics rapport giver europæiske regeringer og virksomheder, der overvejer en sikkerhed-først-leverandør, et usædvanligt konkret datapunkt: elleve måneder med en sikkerhedskontrol, der stille og roligt var slukket, en træningsfejl, der flyttede en model i den forkerte retning, og en uafhængig bedømmer, der kalder de underliggende processer utilstrækkelige. Det er et argument for at tage Anthropics gennemsigtighed alvorligt. Det er ikke i sig selv et argument for at tage noget laboratoriums sikkerhedsmarkedsføring for pålydende, Anthropics inklusive.
Læs videre: Claude fører nu 26 procent af sin egen forskning | Pentagon tabte en Anthropic-sag og vandt den næste



