Samma familj, samma två veckor, motsatt hårdvarunota

Den 3 augusti annonserade Alibaba Qwen3.8-Max: 2,4 biljoner parametrar totalt, omkring 95 miljarder aktiva per förfrågan, och ett löfte om att öppna vikter skulle följa inom en vecka. Det täcktes här vid tillfället, med en beräkning av vad det faktiskt skulle kosta att köra modellen själv: omkring 2,4 terabyte minne för att rymma hela modellen vid 8-bitars precision, mer än vad en enda åtta-GPU H200-nod ger, mitt i en branschomfattande minnesbrist som redan pressade upp komponentpriserna.

Elva dagar senare än det ursprungliga enveckorslöftet, den 14 augusti, kom de öppna vikterna för Qwen3.8-Max, tillsammans med något som det tidigare tillkännagivandet inte hade nämnt: Qwen3.8-27B, en tät modell med 27,78 miljarder parametrar, byggd just för det användningsfall som Max-varianten utesluter - ett enda konsument-GPU.

Vad benchmarkarna faktiskt visar

Alibabas eget modellkort jämför Qwen3.8-27B med Qwen3.6-27B, dess direkta föregångare vid samma parameterantal, vilket är den ärliga jämförelsen för att bedöma generationsframsteg i stället för att jämföra olika storlekar. Terminal-Bench 2.1, som testar om en modell kan utföra reella kommandoradsuppgifter, steg från 63,4 till 73,0. DeepSWE 1.1, ett mjukvaruutvecklingsbenchmark, mer än tredubblades från 13,3 till 42,2. OSWorld-Verified, som mäter genomförande av uppgifter i en verklig skrivbordsmiljö, steg från 63,9 till 84,3. JobBench, som mäter professionell uppgiftslösning i stället för kodgåtor, steg från 21,8 till 33,4 - ett hopp på omkring 50 procent.

Inget av dessa tal gör en modell med 27 miljarder parametrar likvärdig med Max-varianten på 2,4 biljoner parametrar som släpptes samma dag. De betyder däremot att en modell tillräckligt liten för att köras på ett enda GPU i dag klarar uppgifter som en betydligt större modell krävdes för ett år sedan - och det är den egentliga historien: golvet för vad som räknas som en genuint användbar lokal modell fortsätter att sjunka i hårdvarukrav, medan benchmarksiffrorna fortsätter att stiga.

Varför detta delar självhostningsbeslutet i två

För två veckor sedan var det ärliga svaret till en EU- eller UK-ägare som frågade om man skulle självhosta Qwen ett tydligt nej, om inte företaget redan drev multi-GPU-serverinfrastruktur, eftersom flaggskeppsmodellens minnesbehov uteslöt allt mindre. Det svaret har inte ändrats för Max-varianten. Det har ändrats helt för 27B-varianten, som får plats med marginal på ett enda gaming-GPU - samma hårdvaruklass som ett medelstort engineeringteam kanske redan äger för andra syften.

Den praktiska konsekvensen är att självhostning inte längre är ett beslut som ett företag tar en gång för alla. Det är nu ett beslut per arbetsbelastning, per modellstorlek, inom samma familj. Ett team som behöver resonemang i frontier-klass över stora dokumentmängder behöver fortfarande Max-varianten och den multi-GPU-budget som följer med. Ett team som behöver en kapabel coding- eller uppgiftsassistent för interna verktyg kan nu eventuellt köra 27B-varianten på hårdvara det redan äger - till en bråkdel av kostnaden för ett API-abonnemang skalat till samma användning.

Vad du bör kontrollera innan du avfärdar självhostning igen

Om ditt team lade en självhostningsutvärdering åt sidan efter tillkännagivandet den 3 augusti eftersom minnesräkningen inte gick ihop, är det värt att köra om den specifikt med 27B-varianten, inte Max-varianten. Kontrollera tre saker: om din faktiska arbetsbelastning behöver resonemang i Max-klass eller skulle vara väl betjänad av en modell med 27 miljarder parametrar, vad ett enda kapabelt GPU kostar mot ett års API-utgifter vid ditt teams nuvarande användning, och om dina krav på datalokalisering är den egentliga anledningen till självhostning - i så fall är hårdvarukostnaden sekundär i förhållande till compliance-nyttan. De två talen, 2,4 terabyte och ett GPU, beskriver samma Qwen-släpp. Vilket som gäller för dig beror helt på vilken storlek du faktiskt behöver.