Che cosa è stato rilasciato e quale tabella di riferimento c'è sotto

Il 27 luglio Microsoft ha annunciato MAI-Cyber-1-Flash, il suo primo modello di intelligenza artificiale costruito specificamente per la cybersicurezza. L'azienda lo descrive come un modello compatto e molto addestrato sul codice, discendente della linea MAI-Thinking-1, e non lavora da solo. Vive dentro MDASH, l'impalcatura di oltre 100 agenti che Microsoft usa al proprio interno per trovare e correggere vulnerabilità software e che, secondo l'azienda, attinge a più modelli di punta invece che a uno.

Il numero da titolo è il 96 per cento su CyberGym, una prova che misura la capacità di trovare vulnerabilità reali in codice reale. Il confronto pubblicato da Microsoft colloca Mythos di Anthropic all'83,6 per cento, Gemini all'85,6 per cento e GPT da solo all'84,4 per cento, con un quarto modello senza nome all'83,2 per cento. Lo stesso annuncio afferma che la nuova coppia funziona a circa metà del costo della configurazione che Microsoft distribuisce oggi. Satya Nadella l'ha presentata come sicurezza di frontiera a metà prezzo.

Il veicolo commerciale è Project Perception, che entra in anteprima pubblica il 3 agosto dentro Microsoft Defender con prezzi a consumo. Coordina tre classi di agenti: quelli del red team, che tracciano i percorsi di attacco, quelli del blue team, che indagano e ordinano il rischio, e quelli del green team, che applicano le correzioni. Microsoft non ha pubblicato tariffe.

Il risparmio è una scelta di instradamento, non un modello migliore

Se si legge l'architettura, il 96 per cento smette di essere un'affermazione sulle capacità. MAI-Cyber-1-Flash è costruito per assorbire fino al 90 per cento del lavoro dentro MDASH e per inoltrare il decimo più difficile dei compiti a GPT-5.4 di OpenAI. Il punteggio è quello che MDASH ottiene facendo girare i due insieme. Il modello di Microsoft non sta battendo la frontiera: sta gestendo il volume perché alla frontiera restino soltanto le eccezioni.

Questo rende l'affermazione sul costo più interessante di quella sulla precisione. Il 50 per cento è misurato contro la configurazione che Microsoft usa oggi e che l'azienda stessa elenca come GPT-5.4, GPT-5.4 mini e GPT-5.3 codex. In altre parole, il risparmio è stato trovato spostando OpenAI fuori dai nove decimi di routine del lavoro e tenendo OpenAI per il decimo difficile. Un fornitore riduce la propria fattura di acquisto e ne gira una parte al cliente. È una ragione perfettamente valida per comprare, ma non è la stessa cosa di un rilevatore migliore.

La conseguenza sta nelle eccezioni. Il decimo più difficile del lavoro sulle vulnerabilità è per costruzione la parte che un modello economico non riusciva a chiudere: i difetti profondi di logica e i percorsi di codice scomodi. Quel decimo dipende ora dal fatto che un modello di frontiera di terze parti resti disponibile, resti ammesso dalle vostre politiche interne e resti al prezzo di oggi. Nessuna di queste dipendenze compare nel nome del prodotto e nessuna è nelle vostre mani.

L'addebito a consumo cambia che cosa è un budget di sicurezza

Il modello di prezzo merita la stessa attenzione del modello di intelligenza artificiale. Pagare a consumo su un sistema progettato per indagare in continuo significa che la spesa di sicurezza smette di seguire il personale o le postazioni e comincia a seguire la quantità di cose da guardare. Un ambiente rumoroso, un monorepo grande, un'acquisizione che raddoppia il numero di dispositivi, un mese cattivo di allarmi: ognuna di queste cose ha ora un costo diretto e immediato, perché gli agenti rispondono ai segnali e non a un conteggio di licenze.

Per una direzione finanziaria italiana questo è un cambio di previsione, non un cambio di voce. La sicurezza a postazione è un costo fisso che si approva una volta all'anno in euro e poi si dimentica. La sicurezza ad agenti a consumo è un costo variabile che sale esattamente quando siete già sotto pressione, che è la peggiore correlazione possibile per un bilancio. Ed è anche il momento in cui nessuno vuole essere la persona che ha frenato lo strumento di sicurezza per rispettare un numero.

Nulla di tutto questo è un argomento contro l'acquisto. È un argomento per comprare con un tetto, un allarme e un responsabile. Chiedete per iscritto la definizione del contatore prima che apra l'anteprima, concordate un limite interno che apra una discussione e non un blocco, e nominate una persona incaricata di guardare la curva nel primo trimestre.

La domanda da risolvere prima del 3 agosto

Nella maggior parte dei registri fornitori c'è ora una risposta di governance superata. Se rientrate nell'ambito di NIS2 o di DORA, dovete sapere chi tratta la vostra telemetria di sicurezza e i vostri riscontri sulle vulnerabilità. Un'impalcatura di oltre 100 agenti che usa più modelli di punta significa che la risposta onesta comprende almeno due fornitori di modelli, uno dei quali è un concorrente dell'azienda che vi vende il prodotto. Mettetelo per iscritto prima che lo chieda un revisore.

Tre passi pratici questa settimana. Chiedete al vostro rivenditore Microsoft se il consumo di Project Perception viene addebitato dentro l'impegno Defender già in essere o su un contatore separato, e fatevelo dare per iscritto prima del 3 agosto. Chiedete quali classi di modello trattano i riscontri inoltrati e se potete limitare l'inoltro per motivi di policy. Poi verificate se le vostre regole interne sull'invio di codice o di dettagli sulle vulnerabilità a un modello di terze parti sono state scritte dando per assodato che il fornitore di sicurezza fosse un unico responsabile del trattamento.

Questa prova vi verrà citata per tutto l'anno prossimo. Trattate il 96 per cento come proprietà di una coppia e non di un prodotto, e date un prezzo alla coppia di conseguenza.