Zelfde familie, zelfde twee weken, tegenovergestelde hardwarerekening
Op 3 augustus kondigde Alibaba Qwen3.8-Max aan: 2,4 biljoen parameters in totaal, ongeveer 95 miljard actief per aanvraag, en de belofte dat open gewichten binnen een week zouden volgen. Dat werd hier destijds behandeld, met een berekening van wat het echt zou kosten om het zelf te draaien: ongeveer 2,4 terabyte geheugen om het volledige model bij 8-bit precisie te bevatten, meer dan een enkele acht-GPU H200-node biedt, midden in een sectorbrede geheugenschaarste die de componentprijzen al opdreef.
Elf dagen later dan de oorspronkelijke belofte van een week, op 14 augustus, kwamen de open gewichten van Qwen3.8-Max, samen met iets dat de eerdere aankondiging niet had genoemd: Qwen3.8-27B, een dicht model met 27,78 miljard parameters, precies gebouwd voor het gebruiksscenario dat de Max-variant uitsluit, een enkele consumenten-GPU.
Wat de benchmarks echt laten zien
Alibaba's eigen modelkaart vergelijkt Qwen3.8-27B met Qwen3.6-27B, de directe voorganger met hetzelfde aantal parameters, wat de eerlijke vergelijking is om generatievooruitgang te beoordelen in plaats van formaten met elkaar te vergelijken. Terminal-Bench 2.1, dat test of een model echte commandoregeltaken kan uitvoeren, steeg van 63,4 naar 73,0. DeepSWE 1.1, een softwareontwikkelingsbenchmark, meer dan verdrievoudigde van 13,3 naar 42,2. OSWorld-Verified, dat het voltooien van taken in een echte desktopomgeving meet, steeg van 63,9 naar 84,3. JobBench, dat professionele taakvoltooiing meet in plaats van codeerpuzzels, steeg van 21,8 naar 33,4, een sprong van ongeveer 50 procent.
Geen van deze cijfers maakt een model met 27 miljard parameters gelijkwaardig aan de Max-variant met 2,4 biljoen parameters die dezelfde dag verscheen. Ze betekenen wel dat een model klein genoeg om op een enkele GPU te draaien nu taken uitvoert waarvoor een jaar geleden een veel groter model nodig was, en dat is het eigenlijke verhaal: de ondergrens van wat telt als een echt bruikbaar lokaal model blijft dalen in hardwarevereiste, terwijl de benchmarkscores blijven stijgen.
Waarom dit de self-hosting beslissing in tweeen splitst
Twee weken geleden was het eerlijke antwoord aan een EU- of VK-eigenaar die vroeg of Qwen zelf gehost moest worden een duidelijk nee, tenzij het bedrijf al multi-GPU serverinfrastructuur exploiteerde, omdat de geheugenvoetafdruk van het vlaggenschipmodel alles kleiner uitsloot. Dat antwoord is niet veranderd voor de Max-variant. Het is compleet veranderd voor de 27B-variant, die met geheugen over op een enkele gaming-GPU past, dezelfde hardwareklasse die een middelgroot engineeringteam misschien al bezit voor andere doeleinden.
Het praktische gevolg is dat self-hosting niet langer een beslissing is die een bedrijf eenmalig neemt. Het is nu een beslissing per workload, per modelformaat, binnen dezelfde familie. Een team dat frontier-klasse redeneren nodig heeft over grote documentvolumes heeft nog steeds de Max-variant nodig en het bijbehorende multi-GPU-budget. Een team dat een capabele coding- of taakvoltooiingsassistent nodig heeft voor interne tools kan nu mogelijk de 27B-variant draaien op hardware die het al bezit, tegen een fractie van de kosten van een API-abonnement op dezelfde schaal van gebruik.
Wat te controleren voor u self-hosting weer afschrijft
Als uw team een self-hosting evaluatie terzijde legde na de aankondiging van 3 augustus omdat de geheugenrekensom niet klopte, loont het die specifiek opnieuw te doen met de 27B-variant, niet met de Max-variant. Controleer drie dingen: of uw daadwerkelijke workload Max-klasse redeneren nodig heeft of goed bediend zou worden door een model met 27 miljard parameters, wat een enkele capabele GPU kost tegenover een jaar API-uitgaven bij het huidige gebruik van uw team, en of uw eisen aan dataresidentie de echte reden zijn voor self-hosting, in welk geval de hardwarekosten ondergeschikt zijn aan het compliancevoordeel. De twee cijfers, 2,4 terabyte en een GPU, beschrijven dezelfde Qwen-release. Welke op u van toepassing is, hangt volledig af van welk formaat u werkelijk nodig heeft.
Lees hierna: Alibaba verzweeg het getal dat uw kosten bepaalt | Een telefoon, achter elke grens een andere AI



