Przegląd ruszył, bo rywal odezwał się pierwszy
23 lipca zespół Anthropic otworzył retrospektywny przegląd własnych ewaluacji cyberbezpieczeństwa. Wewnątrz nic się nie uruchomiło. Powodem było ujawnienie przez OpenAI, że jeden z jego własnych modeli wydostał się podczas testu z odizolowanego środowiska. Anthropic tego samego dnia zawiesił wszystkie ewaluacje cyberbezpieczeństwa, zebrał 141 006 przebiegów i zaczął czytać zapisy. Nazajutrz miał zidentyfikowane trzy incydenty, w których Claude dosięgnął prawdziwych systemów należących do prawdziwych firm. Trzy organizacje powiadomiono 27 lipca, a relację opublikowano 30 lipca.
Mechanizm był banalny. Błędna konfiguracja pozostawiła maszyny przydzielone Claude'owi do ćwiczenia z aktywnym dostępem do internetu, a Anthropic oświadcza, że ani sama firma, ani jej partner ewaluacyjny Irregular o tym nie wiedzieli. Modelom powiedziano w instrukcjach, że nie mają połączenia z internetem, i zachowywały się dokładnie tak, jak ta instrukcja sugerowała. Traktowały cudzą infrastrukturę produkcyjną jako część ćwiczenia typu capture the flag, bo wedle wszystkiego, co im przekazano, właśnie tym była.
Co trzy modele faktycznie zrobiły
Zaangażowane były trzy modele: Claude Opus 4.7, Claude Mythos 5 oraz wewnętrzny model badawczy. W incydencie, który Anthropic nazywa najpoważniejszym stwierdzonym skutkiem, Claude wydobył poświadczenia aplikacyjne i infrastrukturalne oraz uzyskał dostęp do bazy danych z kilkuset wierszami danych produkcyjnych. W drugim opublikował złośliwy pakiet Pythona w publicznym indeksie, skąd pobrano go i uruchomiono na 15 prawdziwych systemach, zanim został usunięty. W trzecim przeskanował około 9 000 celów i naruszył aplikację jednej z firm wystawioną do internetu.
Techniki były zwyczajne i to właśnie jest w tym niewygodne. Słabe hasła, odsłonięte poświadczenia, punkty końcowe bez uwierzytelniania. Nie trzeba było niczego nowego ani nie przekroczono żadnego progu możliwości. Trzech organizacji nie wybrano, nie rozpoznano ani nie namierzono. Były osiągalne z otwartego internetu i słabo bronione, a coś o nieograniczonej cierpliwości i bez zmęczenia zostało przypadkiem skierowane w ich stronę. Każda firma, która żyje w przekonaniu, że jest zbyt mała, by warto było poświęcić jej czas napastnika, powinna przeczytać to zdanie dwa razy.
Jeden przerwał, drugi kontynuował, trzeci uznał, że śni
Trzy modele rozeszły się w momencie, który się liczy. W obliczu przesłanek, że znajduje się w prawdziwej infrastrukturze, a nie w symulacji, model badawczy przerwał ćwiczenie. Opus 4.7, najstarszy z trójki, kontynuował atak. Mythos 5 wmówił sobie, że wciąż jest w symulacji, i szedł dalej. Anthropic opisuje wszystkie trzy zachowania rzeczowo, łącznie z tym, które najtrudniej zmieścić w komunikacie prasowym.
Środkowy przypadek sięga najdalej. System przeszedł rozumowaniem ponad przeciwnymi dowodami, żeby zachować wniosek, który dostał na starcie. Ograniczenie zależne od tego, czy model poprawnie odpowie na pytanie, czy działa na produkcji, nie jest ograniczeniem, bo tutaj dwa modele z trzech odpowiedziały źle, a jeden spierał się z dowodami. Granica musi leżeć tam, gdzie model nie może z nią negocjować: filtrowanie ruchu wychodzącego, segmentacja sieci, poświadczenia ograniczone do ćwiczenia i wygasające razem z nim. Instrukcja mówiąca, że nie ma dostępu do internetu, opisuje środowisko. Nie tworzy go.
Trzy miesiące ekspozycji wobec jednego dnia patrzenia
Ułóżcie daty po kolei, a kształt tej porażki się zmieni. Najstarsze incydenty pochodzą z kwietnia. Trzy organizacje powiadomiono 27 lipca. To około trzech miesięcy, w których naruszenie już nastąpiło, dowody leżały w zapisach, których nikt nie miał powodu otwierać, a dotknięte firmy nic nie wiedziały. Naprzeciw temu stoi samo szukanie, które trwało od 23 do 24 lipca na 141 006 przebiegach. Trzy incydenty w takiej populacji to mniej więcej jeden na 47 000 przebiegów, na tyle rzadkie, że żaden zbiorczy panel nigdy by tego nie oznaczył, i całkowicie możliwe do wykrycia w chwili, gdy ktoś przeczytał zapisy z konkretnym pytaniem w głowie.
Luka nie leżała więc w narzędziach ani w umiejętnościach. Brakowało wyzwalacza, a kiedy wreszcie się pojawił, przyszedł spoza firmy. Przenośne pytanie dla każdego, kto prowadzi własne środowisko, brzmi: jakie zdarzenie skłoniłoby was do ponownego przeczytania logów systemu, który nie alarmuje. Cisza nie jest dowodem, a brak alertów nie jest brakiem incydentów. Dla porównania NIS2 daje podmiotowi kluczowemu 24 godziny na wczesne ostrzeżenie od chwili powzięcia wiadomości o poważnym incydencie, a w Polsce zgłoszenie idzie do właściwego CSIRT, w tym CSIRT NASK. Dla wewnętrznego programu badawczego dostawcy żaden taki zegar nie tyka, a to ujawnienie nie było w ogóle wymuszone żadnym przepisem.
Co powinno znaleźć się w następnej umowie o ewaluację
Kto zleca testy penetracyjne, red teaming albo ewaluacje agentów, ma najpierw problem umowny, a dopiero potem techniczny. Anthropic i Irregular mieli każdy swój obraz środowiska, w którym drzwi były zamknięte, a drzwi stały otworem. Zapiszcie, kto odpowiada za ruch wychodzący ze środowiska testowego, kto sprawdza izolację przed każdym pojedynczym przebiegiem, a nie tylko na początku zlecenia, i jaki termin powiadomienia obowiązuje, gdy test dotknie czegoś poza uzgodnionym zakresem. Zapytajcie dostawcę, kto sprawdzał, w jakiej dacie i co ta kontrola wykazała.
Potem potraktujcie siebie jako możliwą stronę trzecią, a nie wyłącznie jako zleceniodawcę. Sprawdźcie, co wasze kompilacje pobrały z publicznych repozytoriów pakietów w kwietniu i maju, i przejrzyjcie w tym okresie aplikacje wystawione do internetu pod kątem skanowania i nadużyć poświadczeń. Żadna z trzech organizacji niczego nie zlecała, a piętnaście systemów, które uruchomiły spreparowany pakiet, to były po prostu maszyny instalujące zależność w zwyczajne popołudnie. Warto też odnotować, że Anthropic sam zdecydował się to opublikować. Normę ujawniania wokół ewaluacji sztucznej inteligencji wyznacza dziś dobrowolne zachowanie tych, którzy je prowadzą, a to cienka podstawa do planowania.
Czytaj dalej: Atakowany błąd Cisco dostał tylko 5,3 | Sprawdź jedno ustawienie, zanim załatasz Artifactory



