Stessa famiglia, stesse due settimane, conto hardware opposto
Il 3 agosto Alibaba ha annunciato Qwen3.8-Max: 2,4 trilioni di parametri totali, circa 95 miliardi attivi per richiesta, è la promessa che i pesi aperti sarebbero arrivati entro una settimana. Questa testata ha coperto l'annuncio in quel momento è calcolato quanto sarebbe realmente costato farlo girare in proprio: circa 2,4 terabyte di memoria per contenere il modello completo a precisione 8-bit, più di quanto offra un singolo nodo a otto GPU H200, nel mezzo di una carenza di memoria a livello di settore che già spingeva al rialzo i prezzi dei componenti.
Undici giorni dopo la promessa originale di una settimana, il 14 agosto, sono arrivati i pesi aperti di Qwen3.8-Max, insieme a qualcosa che l'annuncio precedente non aveva menzionato: Qwen3.8-27B, un modello denso da 27,78 miliardi di parametri costruito proprio per il caso d'uso che la variante Max esclude, una singola GPU consumer.
Cosa mostrano davvero i benchmark
La scheda del modello di Alibaba confronta Qwen3.8-27B con Qwen3.6-27B, il suo predecessore diretto allo stesso numero di parametri, che è il confronto onesto per giudicare il progresso generazionale invece di confrontare dimensioni diverse. Terminal-Bench 2.1, che verifica se un modello può completare compiti reali da riga di comando, è salito da 63,4 a 73,0. DeepSWE 1.1, un benchmark di ingegneria del software, è più che triplicato da 13,3 a 42,2. OSWorld-Verified, che misura il completamento di compiti in un vero ambiente desktop, è salito da 63,9 a 84,3. JobBench, che misura il completamento di compiti professionali invece di rompicapi di programmazione, è salito da 21,8 a 33,4, un balzo di circa il 50 per cento.
Nessuno di questi numeri rende un modello da 27 miliardi di parametri equivalente alla variante Max da 2,4 trilioni uscita lo stesso giorno. Significano però che un modello abbastanza piccolo da girare su una singola GPU oggi svolge compiti per cui un anno fa serviva un modello molto più grande, ed è questa la storia vera: la soglia minima per cio che conta come un modello locale genuinamente utile continua a scendere in termini di requisiti hardware mentre i punteggi dei benchmark continuano a salire.
Perché questo divide in due la decisione sull'auto-hosting
Due settimane fa, la risposta onesta per un proprietario UE o del Regno Unito che chiedeva se ospitare Qwen in proprio era un no netto, a meno che l'azienda non gestisse già infrastruttura server multi-GPU, perché l'ingombro di memoria del modello ammiraglia escludeva qualsiasi cosa più piccola. Quella risposta non è cambiata per la variante Max. È cambiata completamente per la variante da 27 miliardi, che sta con margine su una singola GPU da gaming, la stessa classe di hardware che un team di ingegneria di medie dimensioni potrebbe già possedere per altri scopi.
La conseguenza pratica è che l'auto-hosting non è più una decisione che un'azienda prende una volta per tutte. Ora è una decisione per carico di lavoro, per dimensione del modello, all'interno della stessa famiglia. Un team che necessita di ragionamento di frontiera su grandi volumi di documenti ha ancora bisogno della variante Max è del budget multi-GPU che comporta. Un team che necessita di un assistente capace per programmazione o completamento di compiti per strumenti interni potrebbe ora far girare la variante da 27 miliardi su hardware che già possiede, a una frazione del costo di un abbonamento API scalato allo stesso utilizzo.
Cosa verificare prima di scartare di nuovo l'auto-hosting
Se il vostro team ha accantonato una valutazione di auto-hosting dopo l'annuncio del 3 agosto perché i conti sulla memoria non tornavano, vale la pena rifarli specificamente con la variante da 27 miliardi, non con la variante Max. Verificate tre cose: se il vostro carico di lavoro reale necessita di ragionamento di classe Max o sarebbe ben servito da un modello da 27 miliardi di parametri, quanto costa una singola GPU capace rispetto a un anno di spesa API con l'uso attuale del vostro team, è se i vostri requisiti di residenza dei dati sono la vera ragione per l'auto-hosting, nel qual caso il costo hardware diventa secondario rispetto al beneficio di conformita. I due numeri, 2,4 terabyte è una GPU, descrivono lo stesso rilascio Qwen. Quale si applica a voi dipende interamente da quale dimensione vi serve davvero.
Da leggere ora: Alibaba ha taciuto il numero che fissa i costi | Un telefono, un'IA diversa dietro ogni confine



