Anthropic riscrive le regole sulle domande di biologia

Anthropic ha dichiarato questa settimana di aver riscritto la costituzione che governa il classificatore di sicurezza per i contenuti biologici di Fable 5, raccolto il parere di esperti esterni, costruito nuovi dati di addestramento e riaddestrato il sistema per separare le richieste realmente pericolose dalle normali domande cliniche ed educative che venivano coinvolte insieme a esse. L'azienda descrive il cambiamento come una correzione di precisione, non come un allentamento della propria posizione sui domini che considera realmente pericolosi: "Il costo di un uso improprio di Fable in un dominio a duplice uso come la biologia potrebbe essere potenzialmente catastrofico", ha scritto Anthropic, spiegando perché i domini limitati in sé non si sono mossi.

Il risultato, secondo lo stesso annuncio di Anthropic, è un calo di circa l'85% dei fallback di sicurezza legati alla biologia in tutte le superfici prodotto di Fable 5, sebbene l'entità del miglioramento vari notevolmente a seconda di dove viene usato il modello: circa il 67% in meno su Claude.ai, il 55% in meno su Cowork, il 17% in meno su Claude Code e il 7% in meno sulla Claude Platform usata dagli sviluppatori aziendali. Anthropic afferma che le richieste interessate erano per lo più compiti clinici ed educativi ordinari: interpretare risultati di laboratorio, ricercare sintomi o esplorare argomenti di biologia per una lezione o un compito.

I domini che restano completamente bloccati

Fable 5 continua a rifiutare automaticamente un insieme definito di domini a duplice uso: virologia, tossicologia e progettazione molecolare, insieme allo sviluppo professionale di farmaci, indipendentemente da come è formulata la richiesta. Anthropic afferma che le richieste che oltrepassano questa linea vengono reindirizzate a Opus 5, che l'azienda descrive come "un modello capace che non possiede lo stesso livello di capacità biologica di Fable 5". Il reindirizzamento è deliberato: un assistente generico che può comunque risultare utile per il compito sottostante, ma privo del ragionamento biologico di frontiera di cui un malintenzionato avrebbe bisogno per qualcosa di più vicino a un lavoro rilevante per le armi.

Vale la pena soffermarsi su questa distinzione, perché contraddice la lettura errata più clamorosa possibile di questo aggiornamento. Anthropic non sta dicendo che la sua IA sia ora più permissiva sulla biologia in generale. Sta dicendo l'opposto: è ora abbastanza precisa da distinguere la biologia benigna da quella pericolosa, ed è abbastanza sicura di questa distinzione da mantenere bloccata la metà pericolosa esattamente dove si trovava. Il fatto che solo alcuni domini si siano allentati mentre altri restano completamente bloccati è di per sé il segnale che la restrizione non ha mai riguardato davvero la biologia come materia. Ha sempre riguardato un insieme più ristretto di capacità che Anthropic considera catastrofiche se usate in modo improprio, e quell'insieme non è cambiato.

Perché il vecchio attrito era un costo reale, non una diceria

I team europei di sanità, biotecnologia e farmaceutica che hanno usato Claude nell'ultimo anno riconosceranno lo schema che questo aggiornamento vuole correggere. Un medico che chiede a Fable 5 di aiutarlo a interpretare un pannello ematico, un ricercatore biotecnologico che gli chiede di riassumere un meccanismo d'azione, o un dipendente degli affari regolatori farmaceutici che gli chiede di spiegare un termine tossicologico usato in uno studio che sta leggendo, potevano tutti far scattare lo stesso fallback pensato per una richiesta sulle armi biologiche. La soluzione alternativa all'interno di molte organizzazioni europee delle scienze della vita è stata informale e silenziosa: riformulare la domanda, eliminare il vocabolario clinico che fa scattare il filtro, oppure smettere semplicemente di chiedere a Claude e tornare a un motore di ricerca o a un collega.

L'annuncio stesso di Anthropic è, di fatto, un'ammissione che questo attrito era reale e che aveva un costo per gli utenti legittimi, non un'ipotesi sollevata dai critici. L'azienda riconosce che alcune richieste a basso rischio continueranno occasionalmente ad attivare le misure di sicurezza, e afferma che continuerà ad affinare il classificatore in base al riscontro degli utenti, il che suona meno come un giro di vittoria e più come un'azienda che ammette che la sua calibrazione precedente era troppo grossolana per come le persone in ambiti regolamentati e ad alto rischio usano realmente lo strumento.

La tassa di sicurezza che anche altri laboratori di IA dovranno ricalibrare

Anthropic non è l'unico laboratorio di IA che ha peccato di eccessiva cautela generalizzata sui domini scientifici sensibili, e non sarà l'unico a dover ricalibrare pubblicamente man mano che cresce la pressione all'adozione. È prevedibile che OpenAI e Google si trovino di fronte allo stesso identico compromesso: un ampio fallback di sicurezza che blocca una vera richiesta sulle armi biologiche bloccherà anche un vero oncologo, e la pressione commerciale per correggerlo cresce solo man mano che più settori regolamentati fanno passare lavoro serio attraverso questi modelli. L'aggiornamento di questa settimana si legge meglio come la prima mossa di un riassetto a livello di settore su dove si trovi realmente la tassa di sicurezza in biologia, non come una decisione isolata di Anthropic.

Anthropic afferma che un programma di accesso fidato che permetterebbe a ricercatori verificati di lavorare con capacità biologiche di frontiera, senza la restrizione generalizzata applicata a tutti gli altri, è ancora solo "in sviluppo". Fino a quando non sarà disponibile, l'indicazione pratica per qualsiasi organizzazione europea delle scienze della vita resta invariata: le richieste cliniche e di ricerca legittime dovrebbero ora incontrare molti meno rifiuti falsi, ma tutto ciò che tocca procedimentalmente virologia, tossicologia o progettazione molecolare continuerà a essere indirizzato a un modello meno capace, per progettazione, e non ci si dovrebbe aspettare che nessuna formulazione ingegnosa lo cambi.