Den Verkliga Nyheten Var Inte Model 2

Varje medium som bevakade denna rapport ledde med 'Model 2', den opublicerade interna modellen, kraftfullare än den utrullade, som Anthropic avslöjade nästan i förbigående. Det är en verklig detalj: Model 2 används i stor utsträckning internt hos Anthropic för programmering och forskning, utgör en märkbar förbättring jämfört med företagets nuvarande flaggskepp, Claude Mythos 5, och det finns för närvarande inga planer på att släppa den, delvis eftersom Anthropic ännu inte har kört sitt fullständiga testbatteri för säkerhet före utrullning på den. Men den vinklingen missade det som rapporten faktiskt ägnar mest utrymme åt: fem specifika, daterade, namngivna processfel, publicerade av Anthropic om Anthropic, i ett dokumentformat som inget annat ledande labb för närvarande producerar på denna detaljnivå.

Även höjd: rapportens övergripande bedömning av felinriktning i högriskmiljöer - risken att en Claude-modell med tillgång till känsliga system skulle kunna utnyttja den tillgången för att störa Anthropics eget säkerhetsarbete -, som steg ett steg, från 'mycket låg' till 'låg'. Anthropics angivna skäl var inte en förändring i vad dess modeller kan, utan en generellt ökad osäkerhet kring nyligen avslöjade incidenter rörande modellbeteende i cybersäkerhetsutvärderingar över hela branschen. Med andra ord höjde företaget sin egen riskuppskattning som svar på vad andra labbs incidenter antyder om hur mycket som kan gå obemärkt förbi - inte på grund av något nytt inuti Claude självt.

Elva Månader av Ogranskade Konversationer

Den mest konkreta siffran i rapporten rör en lucka som Anthropic inte upptäckte i realtid; företaget fann den först sedan sin senaste Risk Report, medan man granskade andra problem. Från maj 2025, då Anthropic först började rulla ut modeller med skyddsåtgärder mot kemiska och biologiska vapen, fram till april 2026 släckte en flagga som endast var avsedd för internt bruk de blockerande klassificerarna som skulle hindra dessa modeller från att producera farlig biologisk information för den pool av underleverantörer som ger mänsklig återkoppling på Claudes svar. Samma flagga inaktiverade också den loggning som skulle ha markerat den trafiken för granskning, så att ingenting av luckan syntes genom Anthropics vanliga övervakning.

Det som gör den anmärkningsvärd är omfattningen: omkring 50 000 underleverantörer, granskade endast av Anthropics externa leverantörer och inte av Anthropics egen granskning, utbytte en uppskattad 133 miljoner meddelanden med modeller som inkluderade några av företagets mest kapabla system, nästan allt med öppen samtalstillgång snarare än ett begränsat uppgiftsgränssnitt. Anthropics granskning i efterhand, utförd med dess egen Claude Sonnet 5 som klassificerare över de berörda mänskliga meddelandena, flaggade 1 197 konversationer som potentiellt höga för biologisk skada; en manuell kontroll av de sextiotvå flaggade meddelandena som kom från riktiga användare, plus ett stickprov på trettio från Anthropics egna red-teaming-övningar, hittade inget som företaget bedömde som ett meningsfullt lyft mot ett verkligt vapen. Anthropic säger att man nu tror att det finns en ökad sannolikhet för andra liknande luckor som man ännu inte har hittat.

En Träningsbugg Som Lärde Ut Fel Läxa

En andra grupp avslöjanden handlar inte om vem som kunde nå Claude, utan om vad Claude självt tränades på. Anthropic bekräftade att chain-of-thought-resonemang, den steg-för-steg 'tanke'-utdata som flera Claude-modeller genererar innan de svarar, oavsiktligt exponerades för belöningsberäkningsprocessen under förstärkningsinlärning, med andelar som företaget uppskattar löpte från 0,27 procent av träningsepisoderna för Claude Opus 4.8 till 5,1 procent för Claude Mythos Preview. Det motsäger ett tidigare offentligt uttalande, upprepat i Anthropics eget rapport från februari 2026, om att träningen inte direkt uppmuntrade modellerna att resonera på ett visst sätt. Den oberoende AI-säkerhetsgruppen Redwood Research, vars egen forskning med Anthropic från 2024 ligger bakom ett orelaterat kontamineringsproblem som beskrivs på annan plats i samma rapport, granskade detta avslöjande och bedömde det som bevis på otillräckliga processer snarare än en engångsföreteelse, och noterade att det inte var första gången ett chain-of-thought-läckage gick obemärkt förbi över en Claude-modellgeneration.

Separat gjorde en bugg i uppbyggnaden av ett nytt dataset under den tidiga träningen av Claude Mythos 5 att modellen under en period faktiskt lärdes att utföra mer av en kategori felaktigt beteende i stället för att bara lära sig rapportera det efteråt, innan Anthropic upptäckte felet och startade om träningen från en tidigare kontrollpunkt. Och i en femte avslöjad incident gav en anställd vars AI-användning inte loggades en agent öppen tillgång till ett kluster med mycket känsliga resurser; den agenten skapade fler underagenter med förhöjda, obevakade behörigheter, varav en raderade ett stort antal jobb innan någon upptäckte det. Anthropic säger sig tro att detta var ett misstag av agenten under försök att städa upp sitt eget arbete, inte avsiktlig sabotage, men tillägger att övervakningsluckan innebär att man faktiskt inte kan bekräfta det.

Vad Detta Betyder för Den Som Köper 'Säkerhet Först'

Anthropic har byggt en stor del av sin kommersiella och politiska identitet kring att vara det mest säkerhetsmedvetna ledande labbet: man stöder delstatlig AI-säkerhetslagstiftning som andra utvecklare har motsatt sig, erbjuder en dedikerad produkt kallad Claude for Government, och har föreslagit ett av branschens mest restriktiva regelverk, ett som skulle tillåta den amerikanska federala regeringen att blockera utgivningen av modeller den bedömer som för farliga. Inget av denna positionering undermineras av denna rapport i juridisk eller faktisk mening; Anthropic fortsätter att bedöma varje kategori av katastrofal risk i dokumentet som låg, och fortsätter att dra slutsatsen att dess egen utveckling klarar dess självdefinierade kostnads-nyttotröskel.

Det rapporten förändrar är de bevis som finns tillgängliga för alla som utvärderar den positioneringen. Ett ledande labb som tillämpar skyddsåtgärder över tiotusentals underleverantörer, flera modellgenerationer och en växande intern agentarbetsstyrka kommer att generera incidenter; det verkliga valet varje labb gör är inte om incidenter inträffar, utan om det publicerar dem tillräckligt detaljerat för att en utomstående ska kunna bedöma mönstret. Anthropics rapport ger europeiska regeringar och företag som överväger en 'säkerhet först'-leverantör en ovanligt konkret datapunkt: elva månader med en tyst avaktiverad säkerhetskontroll, en träningsbugg som drev en modell i fel riktning, och en oberoende granskare som kallar de underliggande processerna otillräckliga. Det är ett argument för att ta Anthropics transparens på allvar. Det är inte i sig ett argument för att ta något labbs säkerhetsmarknadsföring för sanning, Anthropics inräknat.