Shanghai besvarade frågan som hoppades över i juli

Den 3 augusti lanserade Alibaba Qwen3.8-Max, modellen som visades den 19 juli på World AI Conference i Shanghai utan de siffror som betydde något. Specifikationen är nu offentlig: 2,4 biljoner parametrar totalt, varav 95 miljarder aktiva vid inferens, byggd på arkitekturen Qwen 3.5 och kapabel att hantera text, bilder, video och dokument i ett och samma system. Aktien noterad i Hongkong steg omkring 6 procent till 124,00 Hongkongdollar i tidig handel.

Företaget band sig också vid den punkt det vägrade datera i juli. Vikterna publiceras öppet nästa vecka, vilket skulle göra detta till den första Max-modellen från Qwen som vem som helst kan ladda ned och köra på egen hårdvara. För ett europeiskt företag som följer kinesiska spjutspetsmodeller just därför att öppna vikter tillåter egen drift, granskning och utträde är det den del av beskedet som får följder.

De 95 miljarder aktiva är den verkligt goda nyheten

Därför spelar det roll: aktiveringsgraden är det som förvandlar ett parametertal till en räkning. Qwen3.8-Max använder ungefär 4 procent av sitt nätverk vid varje fråga, så beräkningen per anrop liknar mer en modell på 95 miljarder parametrar än en på 2,4 biljoner. Alibaba placerar inferenskostnaderna under föregående generation, och för en gångs skull stöder den redovisade arkitekturen påståendet i stället för att grumla det.

Det är precis den siffra som saknades i julis förhandsvisning, och den landar på den gynnsamma sidan. För den som köper token via ett gränssnitt är den praktiska slutsatsen att en modell som marknadsförs på 2,4 biljoner parametrar inte ska prissättas som en sådan. Förhandsversionen körs fortfarande till 10 procent av standardtaxan via Token Plan, Qoder och QoderWork, och föregångaren Qwen3.7-Max är noterad till 2,50 dollar per miljon inmatningstoken och 7,50 per miljon utmatningstoken, ungefär 2,30 och 6,90 euro. Bedöm varje erbjudande mot den listan, aldrig mot kampanjpriset.

Räkna sedan minnet, inte parametrarna

Siffran ingen satte i en rubrik: att rymma 2,4 biljoner parametrar kräver omkring 2,4 terabyte minne vid 8-bitars precision, och cirka 1,2 terabyte om du kvantiserar till 4 bitar och accepterar kvalitetsförlusten. En server med åtta grafikprocessorer av typen H200 ger totalt ungefär 1,1 terabyte snabbt minne. Öppna vikter av den här storleken betyder därför inte en server. De betyder minst två fullständiga noder vid 8 bitar, eller en trång passform på en nod efter aggressiv kvantisering, innan du ens avsatt en enda byte till den nyckelvärdescache som faktiskt betjänar samtidiga användare.

Detta infaller under den sämsta tänkbara månaden. Minne är just nu branschens knappaste insatsvara: omkring 70 procent av nästa års utbud är redan bundet, kontraktspriserna på DRAM och HBM har stigit hela kvartalet, och åtstramningen når så långt ned att Apple inte kan hålla en instegsdator i lager utan styr köparna mot en dyrare. Den frihet som öppna vikter ger är verklig, och för de flesta europeiska verksamheter är den för närvarande teoretisk. Man räcker dig nycklarna till en byggnad vars golvyta du inte kan hyra.

Prestandapåståendet är fortfarande Alibaba som mäter Alibaba

Alibaba hävdar att modellen på det hela taget konkurrerar med de ledande amerikanska systemen, att den slår dem i flera prov inom programmering, multimodalitet och teknik och att den ligger efter i vissa allmänna resonemangsprov, och företaget placerar sig återigen strax bakom Anthropics Fable 5. Var och en av dessa placeringar kommer från Alibabas eget lanseringsmaterial. Ingen oberoende rankning har hittills bedömt Qwen3.8-Max, precis som vid julis förhandsvisning.

Ja, men: öppnandet av vikterna ändrar tyngden i den reservationen i stället för att upphäva den. När vikterna är offentliga slutar oberoende utvärdering att bero på leverantörens välvilja eller på tillgång till gränssnittet, och ett rankningspåstående blir motbevisbart inom dagar av var och en som har maskinen att ladda in det. En leverantör som öppnar sina vikter en vecka efter att ha gjort anspråk på en placering är åtminstone beredd att bli kontrollerad. Det riktiga svaret är att invänta den kontrollen, som nu ligger dagar bort och inte på obestämd tid.

Vad detta ändrar för en europeisk köpare denna månad

I din produktionsmiljö ännu ingenting. Ordningen som är värd att följa är smal: låt vikterna landa, låt de oberoende resultaten komma, och testa sedan på din egen arbetslast till fullt listpris i stället för testtaxa. Det är ett beslut i september och inte i augusti, och det kostar ingenting att komma tvåa till en modell som finns kvar om sex veckor.

Slutsatsen: den strategiska fråga som lanseringen väcker är inte om en kinesisk modell är tillräckligt bra. Den är om öppna vikter fortfarande köper oberoende när hårdvaran som krävs för att utöva det är ransonerad. Om egen drift över huvud taget är ditt skäl att följa dessa släpp har den bindande begränsningen tyst flyttat från licensvillkor till minnesinköp, och det är dit planeringsarbetet nu hör.