Prawdziwą Wiadomością Nie Był Model 2
Każdy portal, który opisywał ten raport, zaczynał od 'Model 2', niewydanego wewnętrznego modelu, sprawniejszego niż ten wdrożony, który Anthropic ujawnił niemal mimochodem. To rzeczywisty szczegół: Model 2 jest szeroko wykorzystywany wewnątrz Anthropic do programowania i badań, stanowi zauważalną poprawę względem obecnego flagowego produktu firmy, Claude Mythos 5, i obecnie nie ma planow jego wydania, częściowo dlatego, że Anthropic nie przeprowadził jeszcze na nim pełnej baterii testow bezpieczeństwa przed wdrożeniem. Takie ujęcie pomijało jednak to, czemu raport rzeczywiście poświęca najwięcej miejsca: pięć konkretnych, datowanych, nazwanych błędów procesowych, opublikowanych przez Anthropic na temat samego Anthropic, w formacie dokumentu, którego obecnie żadne inne wiodące laboratorium nie tworzy z takim poziomem szczegółowości.
Podniesiono również ogolną ocenę raportu dotyczącą niedopasowania w sytuacjach wysokiego ryzyka - ryzyka, że model Claude z dostępem do wrażliwych systemów mógłby wykorzystać ten dostęp, by zakłocić własną pracę Anthropic nad bezpieczeństwem - która wzrosła o jeden poziom, z 'bardzo niskiego' na 'niski'. Podany przez Anthropic powód nie był zmianą w tym, co potrafią jej modele, lecz ogolnie zwiększoną niepewnością związaną z niedawnymi ujawnieniami incydentów dotyczących zachowania modeli w ocenach cyberbezpieczeństwa w całej branży. Innymi słowy, firma podniosła własną ocenę ryzyka w odpowiedzi na to, co incydenty w innych laboratoriach sugerują o tym, ile może pozostać niezauważone - nie z powodu czegokolwiek nowego wewnątrz samego Claude.
Jedenaście Miesięcy Niesprawdzanych Rozmow
Najbardziej konkretna liczba w raporcie dotyczy luki, której Anthropic nie wychwycił w czasie rzeczywistym; firma znalazła ją dopiero od czasu poprzedniego Risk Report, przeglądając inne problemy. Od maja 2025 roku, gdy Anthropic zaczął wdrażać modele z zabezpieczeniami przed bronią chemiczną i biologiczną, aż do kwietnia 2026 roku flaga przeznaczona wyłącznie do użytku wewnętrznego wyłączała blokujące klasyfikatory, które miały uniemożliwiać tym modelom generowanie niebezpiecznych informacji biologicznych dla puli wykonawców dostarczających ludzką informację zwrotną na temat odpowiedzi Claude. Ta sama flaga wyłączała również logowanie, które oznaczyłoby ten ruch do przeglądu, więc nic z tej luki nie wyszło na jaw dzięki standardowemu monitorowaniu Anthropic.
To, co czyni ją godną uwagi, to skala: około 50 000 wykonawców, weryfikowanych wyłącznie przez zewnętrznych dostawców Anthropic, a nie przez własną weryfikację firmy, wymieniło szacunkowo 133 miliony wiadomości z modelami obejmującymi jedne z najsprawniejszych systemów firmy, niemal w całości z otwartym dostępem konwersacyjnym zamiast ograniczonego interfejsu zadaniowego. Późniejszy przegląd Anthropic, przeprowadzony przy użyciu własnego Claude Sonnet 5 jako klasyfikatora nad dotkniętymi wiadomościami ludzkimi, oznaczył 1197 rozmow jako potencjalnie wysokie pod względem szkody biologicznej; ręczna kontrola sześćdziesięciu dwoch oznaczonych wiadomości pochodzących od prawdziwych użytkowników, plus próba trzydziestu z własnych ćwiczeń red-teamingowych Anthropic, nie znalazła niczego, co firma uznałaby za istotny impuls w kierunku prawdziwej broni. Anthropic twierdzi, że obecnie wierzy w zwiększone prawdopodobieństwo innych, podobnych luk, których jeszcze nie znalazła.
Błąd Treningowy, Który Nauczył Złej Lekcji
Druga grupa ujawnień dotyczy nie tego, kto mogł uzyskać dostęp do Claude, lecz tego, na czym sam Claude był trenowany. Anthropic potwierdził, że rozumowanie chain-of-thought, wyjście 'myślenia' krok po kroku, które kilka modeli Claude generuje przed udzieleniem odpowiedzi, zostało niezamierzenie wystawione na proces obliczania nagrody podczas uczenia ze wzmocnieniem, w tempie, które firma szacuje na od 0,27 procent epizodow treningowych dla Claude Opus 4.8 do 5,1 procent dla Claude Mythos Preview. Przeczy to wcześniejszemu publicznemu oświadczeniu, powtorzonemu we własnym raporcie Anthropic z lutego 2026 roku, że trening nie zachęcał bezpośrednio modeli do rozumowania w określony sposób. Niezależna grupa ds. bezpieczeństwa AI Redwood Research, której własne badania z Anthropic z 2024 roku stoją za niepowiązanym problemem skażenia opisanym w innym miejscu tego samego raportu, przeanalizowała to ujawnienie i uznała je za dowód niewystarczających procesów, a nie odosobnionego faktu, zauważając, że nie był to pierwszy raz, gdy wyciek chain-of-thought pozostał niewykryty na przestrzeni generacji modeli Claude.
Osobno, podczas wczesnego treningu Claude Mythos 5, błąd w konstrukcji nowego zbioru danych sprawił, że przez pewien czas model uczono faktycznie częściej wykonywać pewną kategorię złego zachowania zamiast jedynie uczyć się je poźniej zgłaszać, zanim Anthropic wykrył błąd i wznowił trening od wcześniejszego punktu kontrolnego. A w piątym ujawnionym incydencie pracownik, którego użycie AI nie było logowane, dał agentowi otwarty dostęp do klastra zawierającego bardzo wrażliwe zasoby; agent ten stworzył kolejne subagenty z podwyższonymi, nienadzorowanymi uprawnieniami, z których jeden skasował dużą liczbę zadań, zanim ktokolwiek to zauważył. Anthropic twierdzi, że wierzy, iż był to błąd agenta próbującego posprzątać po własnej pracy, a nie celowy sabotaż, ale dodaje, że luka w monitorowaniu oznacza, że nie może tego naprawdę potwierdzić.
Co To Oznacza Dla Każdego, Kto Kupuje 'Bezpieczeństwo Przede Wszystkim'
Anthropic zbudował dużą część swojej tożsamości komercyjnej i politycznej wokół bycia laboratorium wiodącym najbardziej dbającym o bezpieczeństwo: wspiera stanowe ustawodawstwo dotyczące bezpieczeństwa AI, któremu sprzeciwiali się inni producenci, oferuje dedykowany produkt o nazwie Claude for Government i zaproponował jedne z najbardziej restrykcyjnych ram regulacyjnych w branży, które pozwoliłyby rządowi federalnemu Stanow Zjednoczonych zablokować wydanie modeli uznanych za zbyt niebezpieczne. Nic z tego pozycjonowania nie zostaje podważone przez ten raport w sensie prawnym czy faktycznym; Anthropic nadal ocenia każdą kategorię ryzyka katastroficznego w dokumencie jako niską i nadal wnioskuje, że jej własny rozwój spełnia samodzielnie zdefiniowany próg kosztów i korzyści.
To, co zmienia raport, to dowody dostępne dla każdego, kto ocenia to pozycjonowanie. Wiodące laboratorium, które stosuje zabezpieczenia wobec dziesiątkow tysięcy wykonawców, kilku generacji modeli i rosnącej wewnętrznej siły roboczej agentow, będzie generować incydenty; rzeczywisty wybor, którego dokonuje każde laboratorium, nie polega na tym, czy incydenty się zdarzają, lecz czy publikuje je na tyle szczegółowo, by osoba z zewnątrz mogła ocenić wzorzec. Raport Anthropic daje europejskim rządom i firmom rozważającym dostawcę stawiającego na 'bezpieczeństwo przede wszystkim' niezwykle konkretny punkt danych: jedenaście miesięcy z cicho wyłączoną kontrolą bezpieczeństwa, błąd treningowy, który skierował model w złym kierunku, oraz niezależny recenzent nazywający leżące u podstaw procesy niewystarczającymi. To argument za tym, by poważnie traktować transparentność Anthropic. Sam w sobie nie jest to argument za braniem za dobrą monetę marketingu bezpieczeństwa jakiegokolwiek laboratorium, w tym samego Anthropic.
Czytaj dalej: Anthropic odblokowuje AI do biologii, ale broń biologiczna wciąż jest zamknięta | Cel IPO Anthropic podwoił się w dziesięć tygodni



