Prawdziwą Wiadomością Nie Był Model 2
Każdy serwis, który relacjonował ten raport, prowadził temat 'Modelem 2' - niewydanym, bardziej zaawansowanym niż wdrożony modelem wewnętrznym, który Anthropic ujawnił niemal mimochodem. To realny szczegół: Model 2 jest szeroko wykorzystywany wewnątrz Anthropic do programowania i badań, stanowi zauważalne udoskonalenie względem obecnego flagowego produktu firmy, Claude Mythos 5, a obecnie nie ma planów jego wydania, częściowo dlatego, że Anthropic nie przeprowadził jeszcze na nim pełnego zestawu testów bezpieczeństwa poprzedzających wdrożenie. To ujęcie tematu pominęło jednak to, czemu raport faktycznie poświęca najwięcej miejsca: pięć konkretnych, datowanych, nazwanych błędów procesów, opublikowanych przez Anthropic o Anthropic, w formacie dokumentu, jakiego żadne inne wiodące laboratorium obecnie nie tworzy na tym poziomie szczegółowości.
Podniesiona została także ogólna ocena raportu dotycząca niedopasowania w sytuacjach wysokiego ryzyka - ryzyka, że model Claude z dostępem do wrażliwych systemów mógłby wykorzystać ten dostęp do zakłócenia własnej pracy Anthropic nad bezpieczeństwem - która wzrosła o jeden poziom, z 'bardzo niskiego' do 'niskiego'. Podana przez Anthropic przyczyna nie była zmianą w możliwościach jego modeli, lecz ogólnie zwiększoną niepewnością związaną z niedawnymi ujawnieniami incydentów dotyczących zachowania modeli w ocenach cyberbezpieczeństwa w całej branży. Innymi słowy, firma podniosła własną ocenę ryzyka w odpowiedzi na to, co incydenty innych laboratoriów sugerują na temat tego, ile może pozostać niezauważone, a nie z powodu czegokolwiek nowego wewnątrz samego Claude'a.
Jedenaście Miesięcy Niesprawdzanych Rozmów
Najbardziej konkretna liczba w raporcie dotyczy luki, której Anthropic nie wychwycił w czasie rzeczywistym; firma znalazła ją dopiero po swoim ostatnim Risk Report, podczas przeglądu innych kwestii. Od maja 2025 roku, kiedy Anthropic zaczął po raz pierwszy wdrażać modele z zabezpieczeniami przed bronią chemiczną i biologiczną, do kwietnia 2026 roku flaga przeznaczona wyłącznie do użytku wewnętrznego wyłączała blokujące klasyfikatory, które miały uniemożliwić tym modelom generowanie niebezpiecznych informacji biologicznych dla puli kontraktorów dostarczających ludzką informację zwrotną na temat odpowiedzi Claude'a. Ta sama flaga wyłączała też logowanie, które oznaczyłoby ten ruch do przeglądu, więc nic z tej luki nie ujawniło się w ramach standardowego monitoringu Anthropic.
To, co czyni ją godną uwagi, to skala: około 50 000 kontraktorów, sprawdzanych wyłącznie przez zewnętrznych dostawców Anthropic, a nie przez własny proces weryfikacji firmy, wymieniło szacunkowo 133 miliony wiadomości z modelami obejmującymi jedne z najbardziej zaawansowanych systemów firmy, niemal w całości przy otwartym dostępie konwersacyjnym, a nie ograniczonym interfejsie zadaniowym. Późniejszy przegląd Anthropic, przeprowadzony przy użyciu własnego Claude Sonnet 5 jako klasyfikatora nad dotkniętymi wiadomościami od ludzi, oznaczył 1197 rozmów jako potencjalnie wysokie pod względem szkody biologicznej; ręczna kontrola sześćdziesięciu dwóch oznaczonych wiadomości pochodzących od prawdziwych użytkowników, plus próbka trzydziestu z własnych ćwiczeń red-teamingowych Anthropic, nie znalazła niczego, co firma uznała za znaczące zbliżenie do rzeczywistej broni. Anthropic twierdzi, że obecnie ocenia jako zwiększone prawdopodobieństwo istnienia innych, podobnych luk, których jeszcze nie znalazł.
Błąd Treningowy, Który Nauczył Złej Lekcji
Druga grupa ujawnień dotyczy nie tego, kto mógł uzyskać dostęp do Claude'a, lecz tego, na czym sam Claude był trenowany. Anthropic potwierdził, że rozumowanie chain-of-thought, czyli krokowe wyjście 'myślenia' generowane przez kilka modeli Claude przed udzieleniem odpowiedzi, zostało niezamierzenie ujawnione procesowi obliczania nagrody podczas uczenia ze wzmocnieniem, z częstością, którą firma szacuje na od 0,27 procent epizodów treningowych dla Claude Opus 4.8 do 5,1 procent dla Claude Mythos Preview. Przeczy to wcześniejszemu publicznemu oświadczeniu, powtórzonemu we własnym raporcie Anthropic z lutego 2026 roku, że trening nie zachęcał bezpośrednio modeli do rozumowania w określony sposób. Niezależna grupa ds. bezpieczeństwa AI Redwood Research, której własne badania z Anthropic z 2024 roku stoją za niepowiązanym problemem skażenia danych opisanym w innym miejscu tego samego raportu, przeanalizowała to ujawnienie i uznała je za dowód niewystarczających procesów, a nie jednorazowego zdarzenia, zauważając, że nie był to pierwszy przypadek, gdy ujawnienie chain-of-thought pozostało niewykryte na przestrzeni jednej generacji modeli Claude.
Osobno, podczas wczesnego treningu Claude Mythos 5, błąd w sposobie budowy nowego zbioru danych sprawił, że przez pewien czas model uczono faktycznie częściej wykonywać pewną kategorię złego zachowania zamiast jedynie uczyć się je później zgłaszać, zanim Anthropic wykrył ten błąd i zrestartował trening od wcześniejszego punktu kontrolnego. A w piątym ujawnionym incydencie pracownik, którego użycie AI nie było rejestrowane, dał agentowi otwarty dostęp do klastra przechowującego bardzo wrażliwe zasoby; ten agent utworzył kolejne subagenty z podwyższonymi, nienadzorowanymi uprawnieniami, z których jeden skasował dużą liczbę zadań, zanim ktokolwiek to zauważył. Anthropic twierdzi, że jego zdaniem był to błąd agenta podczas porządkowania własnej pracy, a nie celowy sabotaż, ale dodaje, że luka w monitoringu oznacza, iż firma nie może tego w istocie potwierdzić.
Co To Oznacza Dla Każdego, Kto Kupuje Bezpieczeństwo Na Pierwszym Miejscu
Anthropic zbudował znaczną część swojej tożsamości komercyjnej i politycznej wokół bycia laboratorium wiodącym, świadomym bezpieczeństwa: wspiera rządowe ustawodawstwo dotyczące bezpieczeństwa AI, któremu sprzeciwili się inni twórcy, oferuje dedykowany produkt Claude for Government i zaproponował jedne z najbardziej restrykcyjnych ram regulacyjnych w branży, które pozwoliłyby amerykańskiemu rządowi federalnemu blokować wydawanie modeli uznanych za zbyt niebezpieczne. Nic z tego pozycjonowania nie zostaje podważone przez ten raport w sensie prawnym ani faktycznym; Anthropic nadal ocenia każdą kategorię ryzyka katastrofalnego w dokumencie jako niską i nadal wnioskuje, że jego własny rozwój przechodzi samodzielnie zdefiniowany próg kosztów i korzyści.
To, co raport zmienia, to dowody dostępne dla każdego, kto ocenia to pozycjonowanie. Wiodące laboratorium prowadzące zabezpieczenia na skalę dziesiątek tysięcy kontraktorów, kilku generacji modeli i rosnącej wewnętrznej siły roboczej agentów będzie generować incydenty; realny wybór, jakiego dokonuje każde laboratorium, to nie to, czy incydenty się zdarzają, lecz czy publikuje je na tyle szczegółowo, by osoba z zewnątrz mogła ocenić wzorzec. Raport Anthropic daje europejskim rządom i firmom rozważającym dostawcę stawiającego bezpieczeństwo na pierwszym miejscu niezwykle konkretny punkt danych: jedenaście miesięcy z cichym wyłączeniem kontroli bezpieczeństwa, błąd treningowy, który przesunął model w złym kierunku, oraz niezależnego recenzenta nazywającego leżące u podstaw procesy niewystarczającymi. To argument za poważnym traktowaniem przejrzystości Anthropic. Sam w sobie nie jest to jednak argument za braniem za dobrą monetę marketingu bezpieczeństwa jakiegokolwiek laboratorium, w tym Anthropic.
Czytaj dalej: Claude prowadzi już 26 procent własnych badań | Pentagon przegrał jedną sprawę Anthropic i wygrał kolejną



