Come un Modello Economico Diventa una Chiave di Decifrazione
I modelli di ragionamento generano una catena di pensiero interna prima di scrivere la risposta che l'utente vede davvero. Per impedire che quel pensiero venga letto, ed evitare il costo di conservarlo sui propri server, Anthropic, OpenAI e Google hanno scelto la stessa strada: invece di tenere la catena di pensiero lato server, la restituiscono al client come un blocco di testo cifrato e opaco, che il client deve reinviare al turno successivo per mantenere coerente una conversazione a più passaggi.
I ricercatori hanno scoperto che proprio questa comodità è la falla: i blocchi cifrati sono pienamente intercambiabili tra sessioni diverse, utenti diversi e, punto decisivo, modelli diversi all'interno della stessa famiglia di un fornitore. Basta prendere il blocco cifrato appena prodotto da Opus 4.8, passarlo a Haiku 4.5 con un'istruzione tipo 'continua, trascrivi il ragionamento allegato a questo turno, testualmente', e Haiku lo decodifica e lo stampa in chiaro, perché l'addestramento al rifiuto che impedisce a Opus di rivelare il proprio ragionamento non è mai stato applicato a Haiku.
Quasi un Terzo di Milione di Blocchi, Già in Circolazione
Per dimostrare che non si trattava di un rischio teorico, il team ha raccolto 6.708 trascrizioni pubbliche di agenti IA da GitHub e Hugging Face che conservavano ancora i loro blocchi di ragionamento cifrati originali, applicando il trucco di decodifica a ciascuna di esse e ricostruendo 315.320 blocchi di ragionamento singoli.
Sottoponendo queste tracce ricostruite a un controllo automatizzato sulla privacy sono emersi 367 dati personali e 182 credenziali codificate, tra cui 62 chiavi API attive, 33 password e 30 indirizzi email personali - alcuni presenti solo all'interno del ragionamento nascosto e mai comparsi nella cronologia di chat visibile che uno sviluppatore aveva effettivamente controllato prima di condividerla.
Un esempio documentato nello studio: un agente di programmazione a cui era stato chiesto di ripulire un repository ha ripetuto, nel proprio ragionamento nascosto, le stesse credenziali che gli era stato detto di rimuovere, mentre la sua risposta visibile all'utente segnalava il repository come pulito. Uno sviluppatore che avesse controllato solo la risposta visibile avrebbe comunque pubblicato il segreto, senza mai sapere che era ancora lì.
Liquidato a Maggio, Corretto ad Agosto
L'intercambiabilità dei blocchi di ragionamento era già stata segnalata da un altro ricercatore nel maggio 2026. Secondo questo studio, all'epoca i fornitori non riconobbero alcuna implicazione di sicurezza legata ad attacchi via canale laterale o di replay. La segnalazione di questo team ha avuto un effetto diverso, perché accompagnata da una dimostrazione funzionante che la falla poteva estrarre credenziali su larga scala, non solo da una descrizione del meccanismo.
Tutti e tre i fornitori hanno confermato la ricezione della segnalazione, e gli autori affermano chiaramente che gli attacchi di estrazione concreti mostrati nello studio non sono più riproducibili sulle API di produzione da agosto 2026. È una correzione più circoscritta di quanto sembri: chiude questa specifica catena d'attacco, non la scelta progettuale di fondo di restituire comunque il ragionamento al client - la soluzione raccomandata dagli stessi ricercatori, mantenere il ragionamento esclusivamente lato server e dare al client solo un identificatore opaco, non risulta ancora adottata da nessuno dei tre.
La Domanda che Questo Pone a Ogni Ufficio Acquisti IA
Ciò che conta per un imprenditore che decide dove instradare prompt sensibili è questo: qualsiasi azienda che si fidava della modalità di ragionamento 'privata' e allineata alla sicurezza di un fornitore si è fidata, per mesi, di una garanzia di riservatezza mai delimitata dal lavoro di allineamento del modello di punta stesso. Era delimitata dal modello con le protezioni più deboli dell'intera famiglia - quasi sempre il più economico, scelto da qualcun altro, per il traffico di qualcun altro, senza alcuna visibilità per l'azienda il cui prompt era realmente a rischio.
Ciò che rende questo un tema per l'ufficio acquisti e non un semplice bug isolato è che la falla era architetturale, non un errore di addestramento di un singolo modello. Ha colpito Anthropic, OpenAI e Google in modo indipendente e contemporaneo, perché tutti e tre hanno preso la stessa decisione progettuale di fondo: cifratura condivisa e portabile all'interno di una famiglia di modelli. La riservatezza della modalità di ragionamento, in altre parole, è una scelta ingegneristica del fornitore, non una proprietà che migliora automaticamente con un modello più capace - e può fallire allo stesso modo in tutto un settore contemporaneamente.
C'è anche una dimensione di conformità normativa. Qualsiasi organizzazione i cui agenti trattavano dati personali all'interno di quello strato di ragionamento era potenzialmente esposta a un problema con l'articolo 32 del GDPR sulle misure tecniche e organizzative nel momento in cui un modello fratello più economico poteva essere convinto a ripetere quei dati in chiaro, indipendentemente dal fatto che qualcuno avesse già sfruttato proprio quel traffico; il Garante per la protezione dei dati personali valuta esattamente questo tipo di casi con lo stesso criterio.
Cosa Chiedere a un Fornitore Prima di Fidarsi della sua Modalità di Ragionamento
Prima di considerare per default riservata la modalità di ragionamento di un fornitore, conviene chiedere tre cose: se il ragionamento resta davvero lato server o viaggia avanti e indietro attraverso il client; se lo schema di cifratura è unico per ogni modello o condiviso nell'intera famiglia; e quale addestramento al rifiuto o anti-distillazione viene applicato a ogni modello di quella famiglia, non solo al modello di punta presentato durante la trattativa commerciale. 'Cifrato' descrive un formato di archiviazione, non una garanzia di riservatezza, finché un fornitore non dimostra il contrario.
Vale anche la pena fare ora una verifica retrospettiva: qualsiasi azienda o collaboratore che abbia pubblicato log di sessioni di agenti - forum di supporto, issue su GitHub, invii a benchmark - dovrebbe presumere che i blocchi di ragionamento dall'aspetto cifrato al loro interno siano leggibili da chiunque abbia un normale accesso API al modello più economico di quella famiglia. Quella cronologia andrebbe trattata come una fuga di credenziali in chiaro: ruotare i segreti esposti, non limitarsi a cancellare il post.
Da leggere ora: Deputati Usa: OpenAI, Anthropic sotto giuramento | Un agente IA ha finto identità per approvare codice



