Il Comportamento di Default Diventato Costoso
La maggior parte degli agenti IA in produzione funziona ancora secondo un'unica ipotesi mai messa in discussione: inviare ogni passaggio di ogni compito al modello più capace disponibile e sistemare la fattura dopo. Per un proof of concept è innocuo. A volumi di produzione - migliaia di compiti di coding, ticket di supporto o passaggi di ricerca al giorno - questa ipotesi trasforma l'abbonamento a un modello di punta nella voce più grande del budget IA, spesso senza che nessuno l'abbia deciso di proposito.
Nvidia ha usato il proprio annuncio dell'11 agosto per sostenere che questo comportamento di default è ormai superato. L'azienda ha lanciato Nemotron 3.5 Lightning, un modello aperto a mescolanza di esperti da 30 miliardi di parametri, di cui solo 3 miliardi attivi per token, insieme a NeMo Switchyard, una libreria open source che decide - compito per compito, a volte turno per turno - quale modello serve davvero. Nessuno dei due è di per sé un nuovo modello di punta. Insieme sono la proposta che il modello di punta dovrebbe essere l'eccezione a cui un agente ricorre, non il punto di partenza.
Un Modello Piccolo e il Router Costruito per Alimentarlo
Nemotron 3.5 Lightning è pensato per il volume, non per le prestazioni massime. Il blog per sviluppatori di Nvidia riferisce che il modello completa 10.000 compiti PinchBench il 30% più velocemente di Qwen3.6 35B a parità di accuratezza, e raggiunge l'86% su quel benchmark con una velocità di output fino a 4 volte superiore a modelli di dimensioni simili - un'affermazione che Nvidia attribuisce alla decodifica speculativa e a due modelli bozza, DSpark e DFlash, calibrati rispettivamente per traffico a bassa e alta concorrenza. Pesi, dati di addestramento e ricette di addestramento vengono rilasciati sotto licenza OpenMDW-1.1, che Nvidia descrive come il proprio rilascio più permissivo finora.
NeMo Switchyard è la parte che cambia davvero il comportamento di un budget. La libreria include tre strategie di routing senza bisogno di configurazione: un classificatore basato su LLM che stabilisce quale modello serve per una richiesta e continua a usarlo per il resto della sessione; uno stage router che legge l'attività recente degli strumenti di un agente e promuove a un modello più forte solo quando rileva difficoltà reali - errori gravi, esplorazione aperta - mantenendo le modifiche di routine e i turni che superano i test sul modello economico; e un escalation router che avvia ogni compito sul modello economico e lo promuove solo dopo aver osservato diversi turni di difficoltà persistente. Una quarta opzione, configurabile, estrae segnali dallo stato interno del modello durante l'addestramento per prevedere, prima che venga generato il primo token, quanto sia davvero difficile la richiesta in arrivo. Nulla di tutto ciò richiede di riscrivere l'applicazione: Switchyard si posiziona davanti al mix esistente di modelli aperti, proprietari e di Nvidia di un team di sviluppo ed è già disponibile su GitHub.
Tre Numeri, Tre Fonti Diverse
Le promesse di risparmio legate a questo lancio sono reali, ma non hanno tutte lo stesso tipo di prova a sostegno, e un'azienda che vi basa il proprio budget dovrebbe tenere ben distinta la differenza. Il benchmark interno di Nvidia riferisce che Switchyard mantiene un'accuratezza di livello di punta riducendo il costo per compito a quasi un terzo rispetto all'uso esclusivo di Claude Opus 4.8 - l'affermazione di un fornitore sul proprio prodotto, utile come stima massima, non come cifra su cui basare un budget.
Due clienti hanno pubblicato proprie cifre indipendenti. LangChain ha testato l'escalation router su 145 compiti Deep Agents multi-turno, instradando tra Nemotron Lightning e Claude Opus 4.8, e ha dichiarato, su cinque esecuzioni separate, una riduzione dei costi del 74% inviando solo il 7% delle chiamate al modello di punta, con un costo in accuratezza misurato di circa 6 punti percentuali - un compromesso che LangChain ha dichiarato apertamente invece di nasconderlo. Separatamente, Ramp, l'azienda di carte aziendali e gestione delle spese, ha testato lo stage router di Switchyard sulla propria suite interna di agenti di coding, Ramp SWE-Bench, e ha dichiarato, tramite il proprio team di ingegneria e la pagina prodotto, che gli agenti instradati eguagliavano le prestazioni di un singolo modello tagliando i costi del 58% e i tempi di esecuzione del 33%; il sistema è ora in produzione nel prodotto router proprietario di Ramp.
Una terza cifra ha prove più deboli, ed è giusto dirlo chiaramente. Il blog tecnico di Nvidia attribuisce a Devin Desktop di Cognition, che esegue lo staged router per gli utenti interni di Nvidia, un costo medio inferiore del 28% sul benchmark FrontierCode Main, con un'accuratezza entro 2,8 punti da quella di punta e un costo medio di 3,11 dollari - circa 2,90 euro al cambio - per compito. Quella cifra proviene dal racconto di Nvidia sull'impiego, non da una pubblicazione indipendente di Cognition - il blog di Cognition descrive una funzione di routing ibrido correlata ma distinta, chiamata Devin Fusion, con cifre di risparmio diverse e non paragonabili. Due delle tre cifre dei clienti qui citate sono confermate in modo indipendente; una no, e va soppesata di conseguenza.
Il Vero Prodotto che Nvidia ha Appena Regalato
Il titolo è un modello più economico e più veloce. La mossa più importante è ciò che Nvidia ha regalato: la politica di routing in sé, aperta, indipendente dal modello, posizionata tra un agente e il mix di modelli aperti, proprietari e di Nvidia che un'azienda sceglie di usare. È una posizione deliberata, non un caso - un router che puntasse solo ai modelli propri di Nvidia sarebbe una storia molto più piccola.
Per un'azienda che opera agenti IA su scala reale, questo cambia cosa significa davvero la dipendenza da un fornitore. Il vecchio rischio di lock-in era essere legati alle API e ai prezzi di un unico laboratorio di punta. Il nuovo rischio è essere legati a qualunque router o framework decida, per conto dell'azienda, quale fornitore chiamare e quanto spesso, perché ora è questo strato, non il modello sottostante, a detenere il costo di cambiare fornitore. Un router capace di spostare il traffico tra Anthropic, endpoint compatibili con OpenAI e pesi aperti a seconda delle necessità è una leva negoziale davvero utile contro qualsiasi laboratorio che alzi i prezzi. Ma è anche una nuova dipendenza che un ufficio acquisti non aveva mai dovuto gestire prima, e il fatto che sia open source non rende gratuito lo sforzo operativo di gestirlo e calibrarlo.
C'è un aspetto di conformità che le aziende europee, in particolare, non possono ignorare. Un router che sposta lo stesso compito tra tre o quattro fornitori di modelli diversi nel corso di una sessione moltiplica il numero di contratti di trattamento dati e subresponsabili che un'azienda deve tracciare ai sensi dell'articolo 28 del GDPR - ogni fornitore toccato da un compito è un subresponsabile, che la decisione di routing sia presa da una persona o da una regola di escalation che nessuno nell'ufficio finanziario ha letto. In Italia, il Garante per la protezione dei dati personali ha già dimostrato, con il blocco temporaneo di ChatGPT nel 2023, quanto rapidamente possa intervenire su una catena di trattamento dati poco chiara; uno strato di routing che aggiunge silenziosamente un quarto o quinto fornitore di modelli a quella catena in una data settimana non è un rischio di controllo ipotetico, è operativo.
Cosa Cambia sulla Scrivania del Direttore Finanziario
La conseguenza pratica è una nuova voce da controllare, non un nuovo strumento da comprare. Un'azienda che già opera agenti IA a volume dovrebbe poter rispondere a una domanda così come un team cloud oggi risponde sul mix tra istanze riservate e on-demand: quale percentuale delle chiamate agli agenti di questo mese ha davvero richiesto il modello di punta, e chi lo ha deciso. La cifra di Ramp - 58% di costi in meno instradando, secondo il proprio racconto, verso l'alto solo i casi realmente difficili - è un obiettivo plausibile per un carico di lavoro di agenti di coding simile al suo, non una garanzia per ogni tipo di carico; un agente di assistenza clienti o un assistente di ricerca instraderà in modo diverso rispetto a uno di ingegneria del software, e il primo passo onesto è misurare l'attuale percentuale di chiamate al modello di punta prima di dare per scontato che un router risolva il problema.
Da leggere ora: Grok Bot Accede alle Tue App e Non Esce Mai | 4.000 app in 30 giorni: la scommessa IA di Cloudflare



