Stessa famiglia, stesse due settimane, conto hardware opposto

Il 3 agosto Alibaba ha annunciato Qwen3.8-Max: 2,4 trilioni di parametri totali, circa 95 miliardi attivi per richiesta, e la promessa che i pesi aperti sarebbero arrivati entro una settimana. Questa testata aveva raccontato l'annuncio in quel momento, calcolando quanto sarebbe realmente costato farlo girare in proprio: circa 2,4 terabyte di memoria per contenere il modello completo a precisione 8-bit, più di quanto offra un singolo nodo a otto GPU H200, nel mezzo di una carenza di memoria a livello di settore che già spingeva al rialzo i prezzi dei componenti.

Undici giorni dopo la promessa originale di una settimana, il 14 agosto, sono arrivati i pesi aperti di Qwen3.8-Max, insieme a qualcosa che l'annuncio precedente non aveva menzionato: Qwen3.8-27B, un modello denso da 27,78 miliardi di parametri costruito proprio per il caso d'uso che la variante Max esclude, una singola GPU consumer.

Cosa mostrano davvero i benchmark

La scheda del modello di Alibaba confronta Qwen3.8-27B con Qwen3.6-27B, il suo predecessore diretto con lo stesso numero di parametri, che è il confronto onesto per giudicare il progresso generazionale invece di mettere a paragone dimensioni diverse. Terminal-Bench 2.1, che verifica se un modello riesce a completare compiti reali da riga di comando, è salito da 63,4 a 73,0. DeepSWE 1.1, un benchmark di ingegneria del software, è più che triplicato, da 13,3 a 42,2. OSWorld-Verified, che misura il completamento di compiti in un vero ambiente desktop, è salito da 63,9 a 84,3. JobBench, che misura il completamento di compiti professionali invece di rompicapi di programmazione, è salito da 21,8 a 33,4, un balzo di circa il 50 per cento.

Nessuno di questi numeri rende un modello da 27 miliardi di parametri equivalente alla variante Max da 2,4 trilioni uscita lo stesso giorno. Significano però che un modello abbastanza piccolo da girare su una singola GPU oggi svolge compiti per cui un anno fa serviva un modello molto più grande, ed è questa la storia vera: la soglia minima per ciò che conta come un modello locale genuinamente utile continua a scendere in termini di requisiti hardware, mentre i punteggi dei benchmark continuano a salire.

Perché questo divide in due la decisione sull'auto-hosting

Due settimane fa, la risposta onesta per un'azienda in UE o nel Regno Unito che chiedeva se ospitare Qwen in proprio era un no netto, a meno che non gestisse già un'infrastruttura server multi-GPU, perché l'ingombro di memoria del modello ammiraglia escludeva qualsiasi cosa più piccola. Quella risposta non è cambiata per la variante Max. È cambiata completamente per la variante da 27 miliardi, che sta con margine su una singola GPU da gaming, la stessa classe di hardware che un team di ingegneria di medie dimensioni potrebbe già possedere per altri scopi.

La conseguenza pratica è che l'auto-hosting non è più una decisione che un'azienda prende una volta per tutte. Ora è una decisione per carico di lavoro, per dimensione del modello, all'interno della stessa famiglia. Un team che ha bisogno di ragionamento di frontiera su grandi volumi di documenti ha ancora bisogno della variante Max e del budget multi-GPU che comporta. Un team che ha bisogno di un assistente capace per programmazione o completamento di compiti per strumenti interni potrebbe ora far girare la variante da 27 miliardi su hardware che già possiede, a una frazione del costo di un abbonamento API scalato allo stesso utilizzo.

Cosa verificare prima di scartare di nuovo l'auto-hosting

Se il vostro team ha accantonato una valutazione di auto-hosting dopo l'annuncio del 3 agosto perché i conti sulla memoria non tornavano, vale la pena rifarli in modo specifico con la variante da 27 miliardi, non con la variante Max. Verificate tre cose: se il vostro carico di lavoro reale richiede ragionamento di classe Max o sarebbe ben servito da un modello da 27 miliardi di parametri, quanto costa una singola GPU capace rispetto a un anno di spesa API con l'uso attuale del vostro team, e se i vostri requisiti di residenza dei dati sono la vera ragione per l'auto-hosting, nel qual caso il costo hardware diventa secondario rispetto al beneficio di conformità. I due numeri, 2,4 terabyte e una GPU, descrivono lo stesso rilascio Qwen. Quale si applica a voi dipende interamente da quale dimensione vi serve davvero.