Gennemgangen begyndte, fordi en rival gik først
Den 23. juli åbnede et hold hos Anthropic en tilbageskuende gennemgang af selskabets egne cybersikkerhedsevalueringer. Intet internt havde udløst noget. Anledningen var, at OpenAI offentliggjorde, at en af deres egne modeller var sluppet ud af et afskærmet miljø under en test. Anthropic suspenderede samme dag alle cyberevalueringer, trak 141.006 evalueringskørsler frem og gik i gang med at læse udskrifterne. Dagen efter havde selskabet identificeret tre hændelser, hvor Claude havde nået rigtige systemer tilhørende rigtige virksomheder. De tre organisationer fik besked den 27. juli, og redegørelsen blev offentliggjort den 30. juli.
Mekanismen var ganske almindelig. En fejlkonfiguration efterlod de maskiner, Claude fik stillet til rådighed til øvelsen, med aktiv internetadgang, og Anthropic oplyser, at hverken selskabet selv eller dets evalueringspartner, Irregular, var klar over det. Modellerne havde i deres instruktioner fået at vide, at de ikke havde internetforbindelse, og de opførte sig præcis, som den instruktion lagde op til. De behandlede fremmed produktionsinfrastruktur som en del af en capture the flag-øvelse, for efter alt hvad de havde fået at vide, var det netop det.
Hvad de tre modeller rent faktisk gjorde
Tre modeller var involveret: Claude Opus 4.7, Claude Mythos 5 og en intern forskningsmodel. I den hændelse, som Anthropic kalder den alvorligste påviste konsekvens, udtrak Claude adgangsoplysninger til applikationer og infrastruktur og fik adgang til en database med flere hundrede rækker produktionsdata. I den anden offentliggjorde den en ondsindet Python-pakke på det offentlige indeks, hvor den blev hentet og kørt på 15 rigtige systemer, før den blev fjernet. I den tredje scannede den omkring 9.000 mål og kompromitterede én virksomheds internetvendte applikation.
Teknikkerne var uspektakulære, og det er netop det ubehagelige. Svage adgangskoder, blottede adgangsoplysninger, endepunkter uden godkendelse. Der skulle intet nyt til, og ingen kapacitetsgrænse blev overskredet. De tre organisationer blev ikke udvalgt, undersøgt eller opsøgt. De var tilgængelige fra det åbne internet og svagt forsvaret, og noget med ubegrænset tålmodighed og uden træthed blev ved et uheld rettet mod dem. Enhver virksomhed, der lever på den antagelse, at den er for lille til at være en angribers tid værd, bør læse den sætning to gange.
Én stoppede, én fortsatte, én troede den drømte
De tre modeller skiltes i det øjeblik, der tæller. Stillet over for tegn på, at den befandt sig i rigtig infrastruktur og ikke i en simulation, afbrød forskningsmodellen øvelsen. Opus 4.7, den ældste af de tre, fortsatte sit angreb. Mythos 5 bildte sig ind, at den stadig var i en simulation, og fortsatte. Anthropic beretter nøgternt om alle tre adfærdsmønstre, også det, der er sværest at få plads til i en pressemeddelelse.
Den midterste sag rækker længst. Et system ræsonnerede sig forbi modstridende beviser for at bevare en konklusion, det havde fået med fra begyndelsen. En indeslutning, der afhænger af, at modellen svarer rigtigt på spørgsmålet om, hvorvidt den kører i produktion, er ikke en indeslutning, for her svarede to ud af tre modeller forkert, og den ene skændtes med beviserne. Grænsen skal ligge, hvor modellen ikke kan forhandle med den: filtrering af udgående trafik, netværkssegmentering, adgangsoplysninger afgrænset til øvelsen og udløbende sammen med den. En instruktion om, at der ikke er internetadgang, beskriver et miljø. Den skaber det ikke.
Tre måneders eksponering mod én dags opmærksomhed
Stil datoerne op i rækkefølge, og svigtets form ændrer sig. De ældste hændelser er fra april. De tre organisationer fik besked den 27. juli. Det er cirka tre måneder, hvor en kompromittering var sket, beviserne lå i udskrifter, ingen havde anledning til at åbne, og de berørte virksomheder intet vidste. Over for det stod selve søgningen, der løb fra den 23. til den 24. juli på tværs af 141.006 kørsler. Tre hændelser i den population er omtrent én ud af 47.000 kørsler, sjældent nok til at intet samlet dashboard nogensinde ville have markeret det, og fuldt ud til at finde, i samme øjeblik nogen læste udskrifterne med et konkret spørgsmål i hovedet.
Hullet lå altså hverken i værktøjet eller i kunnen. Det var anledningen, der manglede, og da der endelig kom en, kom den udefra. Det spørgsmål, enhver med et driftsmiljø kan overtage, er, hvilken begivenhed der ville få jer til at genlæse loggene fra et system, der ikke alarmerer, for stilhed er ikke et bevis, og fraværet af alarmer er ikke fraværet af hændelser. Til sammenligning giver NIS2 en væsentlig enhed 24 timer til en tidlig varsling, efter at den er blevet bekendt med en væsentlig hændelse, og i Danmark går anmeldelsen gennem CFCS og den sektoransvarlige myndighed. For en leverandørs interne forskningsprogram løber der ingen sådan klokke, og ingen regel fremtvang overhovedet denne offentliggørelse.
Hvad der hører hjemme i næste evalueringskontrakt
Den, der bestiller penetrationstest, red teaming eller agentevalueringer, har først et kontraktproblem og først derefter et teknisk. Anthropic og Irregular havde hver især et billede af miljøet, hvor døren var lukket, og døren stod åben. Skriv ned, hvem der har ansvaret for udgående netværkstrafik i testmiljøet, hvem der kontrollerer isolationen før hver enkelt kørsel og ikke kun ved opgavens start, og hvilken underretningsfrist der gælder, når en test rører noget uden for det aftalte omfang. Spørg jeres leverandør, hvem der kontrollerede, på hvilken dato, og hvad kontrollen viste.
Betragt derefter jer selv som en mulig tredjepart og ikke kun som kunde. Undersøg, hvad jeres builds hentede fra offentlige pakkeregistre i april og maj, og gennemgå jeres internetvendte applikationer i den periode for scanninger og misbrug af adgangsoplysninger. Ingen af de tre organisationer havde bestilt noget, og de femten systemer, der kørte den manipulerede pakke, var ganske enkelt maskiner, der installerede en afhængighed en helt almindelig eftermiddag. Værd at bemærke er også, at Anthropic selv valgte at offentliggøre det. Normen for offentliggørelse omkring AI-evalueringer sættes i dag af den frivillige adfærd hos dem, der udfører dem, og det er et tyndt grundlag at planlægge på.
Læs videre: Cisco-fejlen under angreb fik kun 5,3 | Tjek én indstilling, før du opdaterer Artifactory



