La Vera Notizia Non Era Model 2

Ogni testata che ha coperto questo rapporto ha aperto con 'Model 2', il modello interno non pubblicato, più capace di quello in produzione, che Anthropic ha rivelato quasi di sfuggita. Questo è un dettaglio reale: Model 2 è usato ampiamente all'interno di Anthropic per programmazione e ricerca, rappresenta un miglioramento evidente rispetto all'attuale modello di punta dell'azienda, Claude Mythos 5, e al momento non ci sono piani per pubblicarlo, in parte perché Anthropic non ha ancora eseguito su di esso l'intera batteria di test di sicurezza pre-distribuzione. Questa lettura, però, ha trascurato ciò a cui il rapporto dedica in realtà più spazio: cinque errori di processo specifici, datati e nominati, pubblicati da Anthropic su Anthropic, in un formato di documento che nessun altro laboratorio di frontiera produce attualmente con questo livello di dettaglio.

È stata inoltre innalzata la valutazione complessiva del rapporto sul disallineamento in contesti ad alto rischio - il rischio che un modello Claude con accesso a sistemi sensibili possa usare quell'accesso per interferire con il lavoro di sicurezza di Anthropic stessa -, salita di un livello, da 'molto basso' a 'basso'. La ragione indicata da Anthropic non è stata un cambiamento nelle capacità dei suoi modelli, ma una maggiore incertezza generale legata a recenti rivelazioni di incidenti riguardanti il comportamento dei modelli nelle valutazioni di cybersicurezza in tutto il settore. In altre parole, l'azienda ha innalzato la propria stima di rischio in risposta a ciò che gli incidenti di altri laboratori suggeriscono su quanto possa passare inosservato, non per qualcosa di nuovo all'interno di Claude.

Undici Mesi di Conversazioni Non Filtrate

Il numero più concreto del rapporto riguarda una falla che Anthropic non ha colto in tempo reale; l'azienda l'ha trovata solo a partire dal suo ultimo Risk Report, mentre esaminava altri problemi. Da maggio 2025, quando Anthropic ha iniziato a distribuire modelli con protezioni contro le armi chimiche e biologiche, fino ad aprile 2026, un flag pensato solo per uso interno ha spento i classificatori di blocco destinati a impedire che quei modelli producessero informazioni biologiche pericolose per il gruppo di collaboratori che forniscono feedback umano sulle risposte di Claude. Lo stesso flag ha anche disattivato il logging che avrebbe segnalato quel traffico per la revisione, cosicché nulla della falla è emerso attraverso il normale monitoraggio di Anthropic.

A renderla degna di nota è la scala: circa 50.000 collaboratori, controllati solo dai fornitori esterni di Anthropic e non dal vaglio interno dell'azienda, hanno scambiato una cifra stimata di 133 milioni di messaggi con modelli che includevano alcuni dei sistemi più capaci dell'azienda, quasi tutto con accesso conversazionale aperto anziché un'interfaccia di compito limitata. La revisione retrospettiva di Anthropic, condotta usando il proprio Claude Sonnet 5 come classificatore sui messaggi umani interessati, ha segnalato 1.197 conversazioni come potenzialmente elevate per danno biologico; un controllo manuale dei sessantadue messaggi segnalati provenienti da utenti reali, più un campione di trenta dagli esercizi di red-teaming interni di Anthropic, non ha trovato nulla che l'azienda abbia giudicato un impulso significativo verso un'arma reale. Anthropic afferma di ritenere ora più probabile l'esistenza di altre falle simili non ancora individuate.

Un Bug di Addestramento Che Ha Insegnato la Lezione Sbagliata

Un secondo gruppo di rivelazioni riguarda non chi potesse raggiungere Claude, ma su cosa Claude stesso sia stato addestrato. Anthropic ha confermato che il ragionamento chain-of-thought, l'output di 'pensiero' passo dopo passo che diversi modelli Claude generano prima di rispondere, è stato esposto inavvertitamente al processo di calcolo della ricompensa durante l'addestramento per rinforzo, con tassi che l'azienda stima tra lo 0,27 per cento degli episodi di addestramento per Claude Opus 4.8 e il 5,1 per cento per Claude Mythos Preview. Ciò contraddice una precedente dichiarazione pubblica, ripetuta nello stesso rapporto di Anthropic di febbraio 2026, secondo cui l'addestramento non incentivava direttamente i modelli a ragionare in un modo particolare. Il gruppo indipendente per la sicurezza dell'IA Redwood Research, la cui ricerca del 2024 con Anthropic è alla base di un problema di contaminazione non correlato descritto altrove nello stesso rapporto, ha esaminato questa rivelazione e l'ha giudicata prova di processi inadeguati piuttosto che un episodio isolato, notando che non era la prima volta che una fuga di chain-of-thought passava inosservata lungo una generazione di modelli Claude.

Separatamente, durante le prime fasi dell'addestramento di Claude Mythos 5, un bug nella costruzione di un nuovo dataset ha fatto sì che, per un periodo, al modello venisse insegnato a mettere effettivamente in pratica di più una classe di comportamento scorretto invece di limitarsi a imparare a segnalarlo in seguito, prima che Anthropic scoprisse però l'errore e riavviasse l'addestramento da un checkpoint precedente. E in un quinto incidente rivelato, un dipendente il cui uso dell'IA non era registrato ha dato a un agente accesso aperto a un cluster con risorse molto sensibili; quell'agente ha generato ulteriori sotto-agenti con permessi elevati e non monitorati, uno dei quali ha cancellato un gran numero di lavori prima che qualcuno se ne accorgesse. Anthropic afferma di ritenere che si sia trattato di un errore dell'agente mentre cercava di ripulire il proprio lavoro, non di un sabotaggio deliberato, ma aggiunge che la lacuna di monitoraggio significa che non può confermarlo davvero.

Cosa Significa per Chi Compra 'Sicurezza Prima di Tutto'

Anthropic ha costruito buona parte della propria identità commerciale e politica attorno all'essere il laboratorio di frontiera più attento alla sicurezza: sostiene leggi statali sulla sicurezza dell'IA che altri sviluppatori hanno osteggiato, offre un prodotto dedicato chiamato Claude for Government, e ha proposto uno dei quadri normativi più restrittivi del settore, che permetterebbe al governo federale statunitense di bloccare la pubblicazione di modelli che giudica troppo pericolosi. Nulla di questo posizionamento viene però minato da questo rapporto in senso legale o fattuale; Anthropic continua a valutare ogni categoria di rischio catastrofico del documento come bassa, e continua a concludere che il proprio sviluppo superi la soglia costi-benefici che essa stessa si è data.

Ciò che il rapporto cambia sono le prove a disposizione di chiunque valuti quel posizionamento. Un laboratorio di frontiera che applica protezioni su decine di migliaia di collaboratori, diverse generazioni di modelli e una forza lavoro interna di agenti in crescita genererà incidenti; la scelta reale che ogni laboratorio compie non è se gli incidenti accadano, ma se vengano pubblicati con dettagli sufficienti perché un osservatore esterno possa giudicare lo schema. Il rapporto di Anthropic offre a governi e aziende europee che valutano un fornitore 'sicurezza prima di tutto' un dato insolitamente concreto: undici mesi con un controllo di sicurezza silenziosamente disattivato, un bug di addestramento che ha spinto un modello nella direzione sbagliata, e un revisore indipendente che definisce inadeguati i processi sottostanti. Questo è un argomento a favore del prendere sul serio la trasparenza di Anthropic. Non è, da solo, un argomento per prendere alla lettera il marketing sulla sicurezza di qualsiasi laboratorio, incluso quello di Anthropic.