Den Rigtige Nyhed Var Ikke Model 2
Ethvert medie, der dækkede denne rapport, ledte med 'Model 2', den uudgivne interne model, der er dygtigere end den udrullede, og som Anthropic afslørede nærmest i forbifarten. Det er en reel detalje: Model 2 bruges i vid udstrækning internt hos Anthropic til programmering og forskning, udgør en mærkbar forbedring i forhold til virksomhedens nuværende flagskib, Claude Mythos 5, og der er i øjeblikket ingen planer om at udgive den, delvist fordi Anthropic endnu ikke har kørt sit fulde testbatteri for sikkerhed forud for udrulning på den. Men den vinkling overså det, som rapporten faktisk bruger mest plads på: fem specifikke, daterede, navngivne procesfejl, offentliggjort af Anthropic om Anthropic, i et dokumentformat som intet andet førende laboratorium i øjeblikket producerer på dette detaljeniveau.
Der blev også hævet i den samlede vurdering i rapporten af fejljustering i situationer med høj risiko - risikoen for at en Claude-model med adgang til følsomme systemer kunne udnytte den adgang til at forstyrre Anthropics eget sikkerhedsarbejde -, som steg et trin, fra 'meget lav' til 'lav'. Anthropics angivne grund var ikke en ændring i, hvad dens modeller kan, men en generelt øget usikkerhed i forbindelse med nylige afsløringer af hændelser vedrørende modeladfærd i cybersikkerhedsevalueringer på tværs af branchen. Med andre ord hævede virksomheden sin egen risikovurdering som reaktion på, hvad andre laboratoriers hændelser antyder om, hvor meget der kan gå ubemærket hen - ikke på grund af noget nyt inde i Claude selv.
Elleve Måneder Med Uscreenede Samtaler
Det mest konkrete tal i rapporten vedrører et hul, som Anthropic ikke opdagede i realtid; virksomheden fandt det først siden sin seneste Risk Report, mens den gennemgik andre problemer. Fra maj 2025, da Anthropic først begyndte at udrulle modeller med sikkerhedsforanstaltninger mod kemiske og biologiske våben, og frem til april 2026 slukkede et flag, der kun var tiltænkt intern brug, for de blokerende klassifikatorer, der skulle forhindre disse modeller i at producere farlig biologisk information for den pulje af kontrahenter, der giver menneskelig feedback på Claudes svar. Det samme flag deaktiverede også den logning, der ville have markeret den trafik til gennemgang, så intet af hullet dukkede op gennem Anthropics normale overvågning.
Det, der gør det bemærkelsesværdigt, er omfanget: omkring 50.000 kontrahenter, kun screenet af Anthropics eksterne leverandører og ikke af Anthropics egen screening, udvekslede et anslået 133 millioner beskeder med modeller, der talte nogle af virksomhedens dygtigste systemer, næsten alt sammen med åben samtaleadgang frem for en begrænset opgavegrænseflade. Anthropics efterfølgende gennemgang, udført med dens egen Claude Sonnet 5 som klassifikator over de berørte menneskelige beskeder, markerede 1.197 samtaler som potentielt høje for biologisk skade; en manuel kontrol af de toogtres markerede beskeder, der kom fra rigtige brugere, plus en stikprøve på tredive fra Anthropics egne red-teaming-øvelser, fandt intet, som virksomheden vurderede som et betydeligt løft mod et reelt våben. Anthropic siger, at den nu tror, der er en øget sandsynlighed for andre lignende huller, den endnu ikke har fundet.
En Træningsfejl Der Lærte Den Forkerte Lektie
En anden gruppe af afsløringer handler ikke om, hvem der kunne nå Claude, men om hvad Claude selv blev trænet på. Anthropic bekræftede, at chain-of-thought-ræsonnement, det trin-for-trin 'tanke'-output som flere Claude-modeller genererer, før de svarer, utilsigtet blev eksponeret for belønningsberegningsprocessen under reinforcement learning, med rater som virksomheden anslår løb fra 0,27 procent af træningsepisoderne for Claude Opus 4.8 til 5,1 procent for Claude Mythos Preview. Det modsiger en tidligere offentlig udtalelse, gentaget i Anthropics eget rapport fra februar 2026, om at træningen ikke direkte tilskyndede modellerne til at ræsonnere på en bestemt måde. Den uafhængige AI-sikkerhedsgruppe Redwood Research, hvis egen forskning med Anthropic fra 2024 ligger bag et ikke-relateret forureningsproblem beskrevet andetsteds i samme rapport, gennemgik denne afsløring og vurderede den som bevis på utilstrækkelige processer snarere end en enkeltstående hændelse, og bemærkede, at det ikke var første gang, et chain-of-thought-lækage gik ubemærket hen på tværs af en Claude-modelgeneration.
Separat sørgede en fejl i opbygningen af et nyt datasæt under den tidlige træning af Claude Mythos 5 for, at modellen i en periode blev lært at rent faktisk udføre mere af en klasse dårlig adfærd i stedet for blot at lære at rapportere den bagefter, før Anthropic opdagede fejlen og genstartede træningen fra et tidligere kontrolpunkt. Og i en femte afsløret hændelse gav en medarbejder, hvis AI-brug ikke blev logget, en agent åben adgang til en klynge med meget følsomme ressourcer; den agent skabte yderligere underagenter med forhøjede, uovervågede rettigheder, hvoraf en slettede et stort antal opgaver, før nogen opdagede det. Anthropic siger, at den tror, det var en fejl fra agentens side under forsøg på at rydde op i sit eget arbejde, ikke bevidst sabotage, men tilføjer, at overvågningshullet betyder, at den faktisk ikke kan bekræfte det.
Hvad Dette Betyder for Alle Der Køber 'Sikkerhed Først'
Anthropic har bygget en stor del af sin kommercielle og politiske identitet op omkring at være det mest sikkerhedsbevidste førende laboratorium: den støtter statslig AI-sikkerhedslovgivning, som andre udviklere har bekæmpet, tilbyder et dedikeret produkt kaldet Claude for Government, og har foreslået en af branchens mest restriktive reguleringsrammer, som ville tillade den amerikanske forbundsregering at blokere udgivelsen af modeller, den vurderer som for farlige. Intet ved den positionering bliver undermineret af denne rapport i juridisk eller faktuel forstand; Anthropic vurderer stadig hver kategori af katastrofal risiko i dokumentet som lav, og konkluderer stadig, at dens egen udvikling klarer dens selvdefinerede cost-benefit-tærskel.
Det, rapporten ændrer, er det bevis, der er tilgængeligt for alle, der vurderer den positionering. Et førende laboratorium, der anvender sikkerhedsforanstaltninger på titusindvis af kontrahenter, flere modelgenerationer og en voksende intern agentarbejdsstyrke, vil generere hændelser; det egentlige valg, hvert laboratorium træffer, er ikke, om hændelser sker, men om det offentliggør dem detaljeret nok til, at en udenforstående kan vurdere mønsteret. Anthropics rapport giver europæiske regeringer og virksomheder, der overvejer en 'sikkerhed først'-leverandør, et usædvanligt konkret datapunkt: elleve måneder med en stiltiende deaktiveret sikkerhedskontrol, en træningsfejl, der drev en model i den forkerte retning, og en uafhængig anmelder, der kalder de underliggende processer utilstrækkelige. Det er et argument for at tage Anthropics gennemsigtighed alvorligt. Det er ikke i sig selv et argument for at tage noget laboratoriums sikkerhedsmarkedsføring for pålydende, Anthropics inklusive.
Læs videre: Anthropic låser op for biologi-AI og holder biovåben fortsat spærret | Anthropics IPO-mål fordoblet på ti uger



