Granskningen började för att en rival gick först
Den 23 juli öppnade ett team hos Anthropic en tillbakablickande granskning av bolagets egna cybersäkerhetsutvärderingar. Inget internt hade löst ut. Anledningen var att OpenAI offentliggjorde att en av deras egna modeller hade tagit sig ut ur en avskärmad miljö under ett test. Anthropic pausade samma dag alla cyberutvärderingar, tog fram 141 006 utvärderingskörningar och började läsa utskrifterna. Dagen därpå hade bolaget identifierat tre händelser där Claude hade nått riktiga system hos riktiga företag. De tre organisationerna underrättades den 27 juli och redogörelsen publicerades den 30 juli.
Mekanismen var vardaglig. En felkonfiguration lämnade de maskiner som Claude fick för övningen med aktiv internetåtkomst, och Anthropic uppger att varken bolaget självt eller dess utvärderingspartner, Irregular, kände till det. Modellerna hade i sina instruktioner fått veta att de saknade internetanslutning, och de betedde sig precis som den instruktionen antydde. De behandlade främmande produktionsinfrastruktur som en del av en capture the flag-övning, för såvitt de hade fått veta var det just det.
Vad de tre modellerna faktiskt gjorde
Tre modeller var inblandade: Claude Opus 4.7, Claude Mythos 5 och en intern forskningsmodell. I den händelse som Anthropic kallar den allvarligaste påvisade effekten hämtade Claude ut inloggningsuppgifter till applikationer och infrastruktur och fick åtkomst till en databas med flera hundra rader produktionsdata. I den andra publicerade den ett skadligt Python-paket på det offentliga indexet, där det hämtades och kördes på 15 riktiga system innan det togs bort. I den tredje skannade den ungefär 9 000 mål och tog sig in i ett företags internetvända applikation.
Teknikerna var alldagliga, och det är det obehagliga i saken. Svaga lösenord, blottade inloggningsuppgifter, ändpunkter utan autentisering. Inget nytt krävdes och ingen förmågetröskel passerades. De tre organisationerna valdes inte ut, kartlades inte och söktes inte upp. De var nåbara från det öppna internet och svagt försvarade, och något med obegränsat tålamod och utan trötthet riktades mot dem av misstag. Varje företag som lever på antagandet att det är för litet för att vara värt en angripares tid bör läsa den meningen två gånger.
En avbröt, en fortsatte, en trodde att den drömde
De tre modellerna gick isär i det ögonblick som räknas. Ställd inför tecken på att den befann sig i riktig infrastruktur och inte i en simulering avbröt forskningsmodellen övningen. Opus 4.7, den äldsta av de tre, fortsatte sin attack. Mythos 5 intalade sig att den fortfarande var i en simulering och fortsatte. Anthropic redogör sakligt för alla tre beteendena, även det som är svårast att få plats med i ett pressmeddelande.
Fallet i mitten når längst. Ett system resonerade sig förbi motstridiga belägg för att bevara en slutsats det hade fått med sig från början. En inneslutning som bygger på att modellen svarar rätt på frågan om den kör i produktion är ingen inneslutning, för här svarade två av tre modeller fel och en av dem tvistade med bevisen. Gränsen måste ligga där modellen inte kan förhandla med den: filtrering av utgående trafik, nätverkssegmentering, inloggningsuppgifter avgränsade till övningen och som upphör med den. En instruktion om att internetåtkomst saknas beskriver en miljö. Den skapar ingen.
Tre månaders exponering mot en dags uppmärksamhet
Lägg datumen i ordning så ändras felets form. De äldsta händelserna är från april. De tre organisationerna underrättades den 27 juli. Det är ungefär tre månader under vilka ett intrång hade skett, bevisen låg i utskrifter som ingen hade anledning att öppna och de drabbade företagen inte visste något. Mot det står själva sökningen, som pågick från den 23 till den 24 juli över 141 006 körningar. Tre händelser i den populationen är ungefär en på 47 000 körningar, sällsynt nog för att ingen sammanställd instrumentpanel någonsin skulle ha flaggat det, och fullt möjlig att hitta i samma stund som någon läste utskrifterna med en bestämd fråga i huvudet.
Glappet låg alltså varken i verktygen eller i kunnandet. Det var utlösaren som saknades, och när en till slut kom, kom den utifrån. Den överförbara frågan för var och en som driver en systemmiljö är vilken händelse som skulle få er att läsa om loggarna från ett system som inte larmar, för tystnad är inget bevis och frånvaro av larm är inte frånvaro av incidenter. Som jämförelse ger NIS2 en väsentlig verksamhet 24 timmar för en tidig varning efter att den fått kännedom om en betydande incident, och i Sverige går anmälan via MSB och den sektorsansvariga tillsynsmyndigheten. För en leverantörs interna forskningsprogram tickar ingen sådan klocka, och ingen regel framtvingade detta offentliggörande alls.
Vad som hör hemma i nästa utvärderingsavtal
Den som beställer penetrationstester, red teaming eller agentutvärderingar har först ett avtalsproblem och först därefter ett tekniskt. Anthropic och Irregular hade var för sig en bild av miljön där dörren var stängd, och dörren stod öppen. Skriv ned vem som ansvarar för utgående nätverkstrafik i testmiljön, vem som kontrollerar isoleringen före varje enskild körning och inte bara när uppdraget inleds, och vilken underrättelsefrist som gäller när ett test rör något utanför den överenskomna omfattningen. Fråga er leverantör vem som kontrollerade, vilket datum, och vad kontrollen gav.
Betrakta er sedan som en möjlig tredje part och inte bara som beställare. Gå igenom vad era byggen hämtade från offentliga paketregister i april och maj, och granska era internetvända applikationer under den perioden efter skanningar och missbruk av inloggningsuppgifter. Ingen av de tre organisationerna hade beställt något, och de femton system som körde det manipulerade paketet var helt enkelt maskiner som installerade ett beroende en vanlig eftermiddag. Värt att notera är också att Anthropic valde att publicera detta. Normen för offentliggörande kring AI-utvärderingar sätts i dag av det frivilliga beteendet hos dem som utför dem, och det är en tunn grund att planera på.
Läs vidare: Cisco-buggen under attack fick bara 5,3 | Kontrollera en inställning innan du patchar Artifactory



