Samme familie, samme to uger, modsat hardwareregning

Den 3. august annoncerede Alibaba Qwen3.8-Max: 2,4 billioner parametre i alt, omkring 95 milliarder aktive per foresporgsel, og et løfte om at åbne vægte ville følge inden en uge. Det blev dækket her på det tidspunkt, med en beregning af hvad det reelt ville koste selv at drive: omkring 2,4 terabyte hukommelse for at rumme hele modellen ved 8-bit præcision, mere end en enkelt otte-GPU H200-node giver, midt i en brancheomfattende hukommelsesmangel, der allerede pressede komponentpriserne op.

Elleve dage senere end det oprindelige et-uges løfte, den 14. august, ankom de åbne vægte til Qwen3.8-Max, sammen med noget den tidligere annoncering ikke havde nævnt: Qwen3.8-27B, en tæt model med 27,78 milliarder parametre, bygget netop til det anvendelsesscenarie, som Max-varianten udelukker, et enkelt forbruger-GPU.

Hvad benchmarkene faktisk viser

Alibabas eget modelkort sammenligner Qwen3.8-27B med Qwen3.6-27B, dens direkte forgænger ved samme parameterantal, hvilket er den ærlige sammenligning for at vurdere generationsfremskridt frem for at sammenligne på tværs af størrelser. Terminal-Bench 2.1, der tester om en model kan udføre reelle kommandolinjeopgaver, steg fra 63,4 til 73,0. DeepSWE 1.1, et softwareudviklings-benchmark, mere end tredobledes fra 13,3 til 42,2. OSWorld-Verified, der måler udførelse af opgaver i et reelt skrivebordsmiljo, steg fra 63,9 til 84,3. JobBench, der måler professionel opgaveløsning frem for kodegåder, steg fra 21,8 til 33,4, et spring på omkring 50 procent.

Ingen af disse tal gør en model med 27 milliarder parametre ligeværdig med Max-varianten på 2,4 billioner parametre, der udkom samme dag. De betyder til gengæld, at en model lille nok til en enkelt GPU nu klarer opgaver, som en langt storre model skulle bruges til for et år siden, og det er den egentlige historie: grænsen for, hvad der tæller som en genuint nyttig lokal model, bliver ved med at falde i hardwarekrav, mens benchmark-tallene fortsat stiger.

Hvorfor det deler selvhosting-beslutningen i to

For to uger siden var det ærlige svar til en EU- eller UK-ejer, der spurgte om man skulle selvhoste Qwen, et klart nej, medmindre virksomheden allerede drev multi-GPU-serverinfrastruktur, fordi flagskibsmodellens hukommelsesbehov udelukkede alt mindre. Det svar har ikke ændret sig for Max-varianten. Det har ændret sig fuldstændigt for 27B-varianten, der passer med hukommelse til overs på et enkelt gaming-GPU, samme hardwareklasse som et mellemstort engineeringteam måske allerede ejer til andre formål.

Den praktiske konsekvens er, at selvhosting ikke længere er en beslutning en virksomhed træffer en gang for alle. Det er nu en beslutning per arbejdsbyrde, per modelstørrelse, inden for samme familie. Et team, der har brug for frontier-klasse ræsonnement på tværs af store dokumentmængder, har stadig brug for Max-varianten og det multi-GPU-budget, der følger med. Et team, der har brug for en dygtig coding- eller opgaveassistent til interne værktøjer, kan nu muligvis køre 27B-varianten på hardware, det allerede ejer, til en brokdel af prisen på et API-abonnement skaleret til samme forbrug.

Hvad du bør tjekke før du afskriver selvhosting igen

Hvis dit team lagde en selvhosting-vurdering på hylden efter annonceringen den 3. august, fordi hukommelsesregnestykket ikke gik op, er det værd at køre det igen specifikt med 27B-varianten, ikke Max-varianten. Tjek tre ting: om din faktiske arbejdsbyrde kræver Max-klasse ræsonnement eller ville være godt dækket af en model med 27 milliarder parametre, hvad et enkelt kraftfuldt GPU koster mod et års API-forbrug ved dit teams nuværende brug, og om dine krav til datalokation er den egentlige grund til selvhosting, i så fald er hardwareomkostningen sekundær i forhold til compliance-gevinsten. De to tal, 2,4 terabyte og et GPU, beskriver samme Qwen-udgivelse. Hvilket der gælder for dig, afhænger helt af hvilken størrelse du faktisk har brug for.