Anthropic przepisuje zasady dotyczące pytań o biologię
Anthropic poinformował w tym tygodniu, że przepisał konstytucję rządzącą klasyfikatorem bezpieczeństwa treści biologicznych w Fable 5, zebrał opinie zewnętrznych ekspertów, zbudował nowe dane treningowe i ponownie wytrenował system, aby oddzielić naprawdę niebezpieczne żądania od zwykłych pytań klinicznych i edukacyjnych, które wcześniej były wyłapywane razem z nimi. Firma przedstawia tę zmianę jako korektę precyzyjną, a nie złagodzenie swojego stanowiska wobec domen, które uznaje za naprawdę niebezpieczne: "Koszt niewłaściwego wykorzystania Fable w domenie podwójnego zastosowania, jaką jest biologia, mógłby być potencjalnie katastrofalny", napisał Anthropic, wyjaśniając, dlaczego same ograniczone domeny się nie zmieniły.
Wynik, według własnego ogłoszenia Anthropic, to spadek o około 85% liczby zabezpieczeń związanych z biologią we wszystkich powierzchniach produktowych Fable 5, choć skala poprawy różni się wyraźnie w zależności od miejsca korzystania z modelu: około 67% mniej w Claude.ai, 55% mniej w Cowork, 17% mniej w Claude Code i 7% mniej w Claude Platform, z którego korzystają programiści firmowi. Anthropic twierdzi, że dotknięte żądania dotyczyły głównie zwykłych zadań klinicznych i edukacyjnych: interpretacji wyników badań laboratoryjnych, wyszukiwania informacji o objawach lub zgłębiania tematów biologicznych na potrzeby lekcji czy pracy pisemnej.
Domeny, które pozostają całkowicie zablokowane
Fable 5 nadal automatycznie odmawia odpowiedzi w ściśle określonym zbiorze domen podwójnego zastosowania: wirusologii, toksykologii i projektowania molekularnego, a także profesjonalnego rozwoju leków, niezależnie od sposobu sformułowania żądania. Anthropic twierdzi, że żądania przekraczające tę granicę są zamiast tego przekierowywane do Opus 5, który firma opisuje jako "zdolny model, który nie ma takiego samego poziomu możliwości biologicznych jak Fable 5". Przekierowanie jest celowe: uniwersalny asystent, który wciąż może być użyteczny w wykonaniu danego zadania, ale bez rozumowania biologicznego na najwyższym poziomie, jakiego potrzebowałby złośliwy aktor do czegokolwiek bliższego pracy istotnej dla broni.
Warto zatrzymać się nad tym rozróżnieniem, ponieważ przeczy ono najgłośniejszej możliwej błędnej interpretacji tej aktualizacji. Anthropic nie mówi, że jego AI jest teraz ogólnie bardziej pobłażliwa wobec biologii. Firma mówi coś przeciwnego: jest teraz na tyle precyzyjna, by odróżnić niegroźną biologię od niebezpiecznej, i na tyle pewna tego rozróżnienia, by trzymać niebezpieczną połowę zablokowaną dokładnie tam, gdzie była wcześniej. Fakt, że złagodzono tylko niektóre domeny, podczas gdy inne pozostały całkowicie zablokowane, sam w sobie jest dowodem, że ograniczenie nigdy tak naprawdę nie dotyczyło biologii jako dziedziny. Zawsze chodziło o węższy zbiór możliwości, które Anthropic uznaje za katastrofalne w przypadku niewłaściwego użycia, a ten zbiór się nie zmienił.
Dlaczego dawne tarcie było realnym kosztem, a nie plotką
Europejskie zespoły z sektora ochrony zdrowia, biotechnologii i farmacji, które korzystały z Claude przez ostatni rok, rozpoznają wzorzec, który ma naprawić ta aktualizacja. Lekarz proszący Fable 5 o pomoc w interpretacji wyników badania krwi, badacz biotechnologiczny proszący o podsumowanie mechanizmu działania, czy pracownik działu spraw regulacyjnych w firmie farmaceutycznej proszący o wyjaśnienie terminu toksykologicznego użytego w czytanym badaniu, mogli wszyscy wyzwolić to samo zabezpieczenie przeznaczone dla zapytań o broń biologiczną. Obejście stosowane w wielu europejskich organizacjach z sektora nauk przyrodniczych było nieformalne i ciche: przeformułowanie pytania, usunięcie słownictwa klinicznego wyzwalającego filtr albo po prostu zaprzestanie pytania Claude i powrót do wyszukiwarki lub kolegi.
Własne ogłoszenie Anthropic jest w praktyce przyznaniem, że to tarcie było realne i miało koszt dla uprawnionych użytkowników, a nie hipotetycznym zarzutem podnoszonym przez krytyków. Firma przyznaje, że niektóre żądania niskiego ryzyka wciąż będą sporadycznie uruchamiać środki bezpieczeństwa, i twierdzi, że będzie nadal udoskonalać klasyfikator na podstawie opinii użytkowników, co brzmi mniej jak okrążenie honorowe, a bardziej jak przyznanie się firmy, że jej wcześniejsza kalibracja była zbyt gruba w stosunku do sposobu, w jaki ludzie w regulowanych, obarczonych wysokim ryzykiem dziedzinach faktycznie korzystają z tego narzędzia.
Podatek bezpieczeństwa, który będzie musiało przekalibrować też inne laboratoria AI
Anthropic nie jest jedynym laboratorium AI, które skłaniało się ku ogólnej nadmiernej ostrożności w newralgicznych domenach naukowych, i nie będzie jedynym, które będzie musiało publicznie przekalibrować się w miarę narastania presji adopcyjnej. Należy się spodziewać, że OpenAI i Google staną przed dokładnie tym samym kompromisem: szeroko zakrojone zabezpieczenie blokujące prawdziwe zapytanie o broń biologiczną zablokuje też prawdziwego onkologa, a presja komercyjna, by to naprawić, rośnie tylko wraz z tym, jak coraz więcej regulowanych branż kieruje poważną pracę przez te modele. Aktualizację z tego tygodnia najlepiej odczytywać jako pierwszy ruch w ogólnobranżowym przemodelowaniu tego, gdzie faktycznie leży podatek bezpieczeństwa w biologii, a nie jako jednorazową decyzję Anthropic.
Anthropic twierdzi, że program zaufanego dostępu, który pozwoliłby zweryfikowanym badaczom pracować z możliwościami biologicznymi na najwyższym poziomie, bez ogólnego ograniczenia nałożonego na wszystkich pozostałych, wciąż jest jedynie "w fazie rozwoju". Do czasu jego uruchomienia praktyczne wskazówki dla każdej europejskiej organizacji z sektora nauk przyrodniczych pozostają niezmienione: uzasadnione zapytania kliniczne i badawcze powinny teraz napotykać znacznie mniej fałszywych odmów, ale wszystko, co proceduralnie dotyka wirusologii, toksykologii lub projektowania molekularnego, wciąż będzie celowo kierowane do mniej zdolnego modelu, i nie należy oczekiwać, że jakiekolwiek sprytne sformułowanie to zmieni.
Czytaj dalej: Blokada robota opublikowała wasze rozmowy | Naprawa awarii Claude nadejdzie dopiero w 2027



