Un numero, non un altro avvertimento
L'8 settembre il responsabile scienza dell'allineamento di Anthropic ha messo un numero preciso sul rischio che il suo datore di lavoro costruisce ogni giorno. Evan Hubinger, rispondendo a un collega in uscita, ha scritto di vedere personalmente una probabilità superiore al 10 per cento che l'IA causi l'estinzione umana entro il prossimo decennio.
Il collega era proprio Jacob Coxon, ricercatore di 27 anni che ha passato tre anni nel pretraining, prima da OpenAI sul modello GPT-4o, poi da Anthropic. Coxon si è dimesso martedì sera scrivendo che entrambi i laboratori "corrono dritti verso una superintelligenza capace di auto-migliorarsi, giocandosi le nostre vite", aggiungendo che chi costruisce questa tecnologià "crede sul serio che potrebbe ucciderci tutti entro la fine del decennio". Hubinger gli ha dato ragione, precisando che il rischio a cui pensa deriva in particolare dall'auto-miglioramento ricorsivo, non dai modelli commerciali che Anthropic vende oggi.
Perché un numero dall'interno suona diverso
Le stime pubbliche sul rischio catastrofico dell'IA non sono una novità, ricercatori e attivisti esterni pubblicano sondaggi da anni. Ciò che è cambiato l'8 settembre è chi ha parlato: la persona a cui Anthropic stessa ha affidato la guida della scienza dell'allineamento, pubblicamente e con un numero, non solo un'impressione.
Al momento in cui questa notizia veniva riportata, Anthropic non aveva diffuso una dichiarazione aziendale sul numero, e Hubinger ha precisato esplicitamente che si trattava di una sua opinione personale, non di una posizione ufficiale dell'azienda. Questa distinzione non sopravvive a un foglio di calcolo degli acquisti. Il numero di un responsabile del rischio con nome e cognome, per quanto personale, è esattamente il tipo di prova che un team di conformita può davvero mettere a verbale.
L'aspetto di conformità che la cronaca ha ignorato
L'articolo 55 dell'AI Act europeo impone dal 2 agosto 2025 ai fornitori di modelli di IA per finalita generali con rischio sistemico di valutare e documentare tali rischi, e dal 2 agosto 2026, poco più di un mese prima del messaggio di Hubinger, l'Ufficio IA ha ottenuto il potere formale di verificarne il rispetto.
Gli obblighi sono precisi: valutazione standardizzata del modello con test avversariali inclusi, valutazione e mitigazione del rischio sistemico su tutto il mercato UE, segnalazione degli incidenti gravi all'Ufficio IA e adeguata sicurezza informatica per il modello stesso. I fornitori la cui potenza di calcolo di addestramento supera la soglia di rischio sistemico fissata dalla legge, la fascia in cui si collocano i laboratori di punta come Anthropic, sono esattamente i destinatari di questo articolo. Un numero di rischio dichiarato dalla persona che guida il lavoro di allineamento di quel fornitore è esattamente il tipo di rischio prevedibile che un regolatore o un revisore ora cercherà.
Cosa cambia per chi acquista lo strumento
Nel prodotto oggi non cambia nulla. Nessun modello è stato ritirato, nessuna funzione è stata disattivata, e la stessa precisazione di Hubinger legava la sua stima a uno scenario futuro, non all'assistente che in questo momento risponde alle domande del vostro team.
Ciò che dovrebbe cambiare, perciò, è la documentazione. I registri di rischio fornitori che oggi riportano qualcosa come "preoccupazioni sulla sicurezza IA, sotto osservazione" possono ora citare un numero con fonte, data e nome. E qualsiasi team che dipende da un unico laboratorio di punta per un processo centrale dovrebbe trattare quella dipendenza come un rischio di concentrazione dichiarato, non come una nota a margine, dato che il numero viene da dentro il fornitore e non da un critico esterno.
Da leggere ora: Il Vostro Fornitore Di IA Ha Appena Ricevuto Una Lettera Da Bruxelles | Il Rapporto sulla Sicurezza di Anthropic Elenca i Suoi Errori



