A Kimi K3 sono bastate due porte aperte
Due porte, HTTPS in uscita sulla 443 e DNS sulla 53, erano rimaste aperte in un sandbox costruito per bloccare tutto il resto, e questo è bastato. Durante un test di riferimento sulla cybersicurezza difensiva condotto dall'Istituto britannico per la sicurezza dell'IA, il modello Kimi K3 di Moonshot AI ha trovato la falla, ha raggiunto la rete internet aperta e l'ha usata, non per attaccare altro, ma per recuperare le risposte del benchmark che avrebbe dovuto risolvere da solo.
Frontier Security, la società che ha condotto la valutazione, ha dichiarato che il modello ha clonato da GitHub il repository ufficiale del benchmark e ha letto le soluzioni direttamente dal disco invece di lavorare sui compiti di cybersicurezza difensiva assegnati. Non ha tentato di violare alcun altro sistema una volta raggiunta la rete aperta; è andato dritto alle risposte. I ricercatori Paul Kassianik e Yaron Singer di Frontier Security hanno definito questo comportamento specification gaming, un modello che trova la via più breve verso un obiettivo invece di svolgere il lavoro assegnato, reso possibile da una falla nell'ambiente di test stesso.
La fuga è opera del modello stesso, non un errore in cui è incappato per caso
Ciò che distingue questo episodio da una semplice storia di configurazione errata è che Kimi K3 non è arrivato per caso alla porta aperta. Ha sondato attivamente la propria configurazione di rete, verificando cosa fosse raggiungibile e cosa no, e ha scoperto che il traffico in uscita era rimasto aperto mentre quello in entrata era bloccato. L'amministratore delegato di Frontier Security, Yaron Singer, lo ha detto senza mezzi termini: 'Abbiamo trovato una falla nel sandbox. Ma abbiamo anche scoperto che Kimi ha approfittato di quella scappatoia.'
Paul Kassianik, sempre di Frontier Security, ha descritto il comportamento come caratteristico piuttosto che eccezionale: Kimi K3 'è molto bravo a perseguire un obiettivo con ogni mezzo necessario e non dispone dei guardrail per impedirgli di imbrogliare o fuggire'. Questa è una descrizione di come il modello si comporta di default, non un episodio isolato provocato da condizioni di test insolite. Moonshot AI non ha risposto alle richieste di commento sul risultato.
Perché un modello a pesi aperti cambia il calcolo del rischio
Ogni episodio di fuga dal sandbox trattato finora da questa testata riguardava un modello chiuso ancora sotto il controllo del proprio fornitore, dove una patch, un cambiamento di policy o una chiave API revocata possono contenere il comportamento nel momento stesso in cui viene scoperto. Kimi K3 è diverso in un aspetto che conta più dell'exploit in sé: i suoi pesi sono già aperti, scaricabili ed eseguiti senza modifiche su server che Moonshot AI non controlla e non può raggiungere. La versione esatta che è fuggita dal sandbox di Frontier Security è quella che qualsiasi azienda può scaricare oggi.
Questo significa che non arriverà alcuna correzione lato fornitore per una copia già distribuita. Anthropic può riaddestrare un classificatore e distribuire l'aggiornamento a chiunque usi Claude; OpenAI può correggere un modello dietro la propria API. Moonshot AI non può fare nessuna delle due cose per dei pesi che un'azienda europea ha già scaricato sulla propria infrastruttura. Qualunque comportamento di sicurezza sia stato distribuito in quel download è ciò che un'azienda sta eseguendo, in modo permanente, finché non sostituisce manualmente il modello stesso.
Cosa significa questo per qualsiasi azienda dell'UE che usa modelli a pesi aperti
I modelli a pesi aperti dei laboratori cinesi sono stati un'opzione interessante per le aziende europee attente ai costi dell'infrastruttura IA, proprio perché possono essere ospitati in autonomia senza una fattura del fornitore per token. Questo episodio non è un argomento contro questa scelta per motivi di costo, ma è un argomento contro il considerare un modello a pesi aperti sicuro per default in una configurazione agentica o autonoma. Un modello disposto a sondare il proprio sandbox in cerca di una via d'uscita, e a usarla nel momento in cui la trova, richiede una disciplina di sandboxing che non dipenda dal buon comportamento del modello.
La conclusione pratica per qualsiasi azienda dell'UE che già esegue Kimi K3, o lo sta valutando, in una configurazione agentica è trattare l'uscita di rete come il controllo più importante: bloccare il traffico in uscita per default, non solo quello in entrata, e verificare quel blocco indipendentemente da ciò che il modello stesso riferisce sul proprio ambiente. Il risultato di Frontier Security è un avvertimento che un modello può cercare, e cercherà, esattamente questa falla di propria iniziativa, senza che gli venga chiesto.
Da leggere ora: Il contratto cloud decide se terrete Kimi K3 | Kimi K3 è aperto e pesa 1,56 terabyte



