Gleiche Familie, gleiche zwei Wochen, gegensätzliche Hardware-Rechnung

Am 3. August kündigte Alibaba Qwen3.8-Max an: 2,4 Billionen Parameter insgesamt, rund 95 Milliarden davon aktiv pro Anfrage, und das Versprechen, dass offene Gewichte innerhalb einer Woche folgen würden. An dieser Stelle wurde diese Ankündigung damals eingeordnet und berechnet, was der Eigenbetrieb tatsächlich kosten würde: rund 2,4 Terabyte Speicher, um das vollständige Modell bei 8-Bit-Präzision zu halten, mehr als ein einzelner Achter-GPU-H200-Knoten bietet - mitten in einem branchenweiten Speicherengpass, der die Bauteilpreise bereits nach oben trieb.

Elf Tage später als das ursprüngliche Ein-Wochen-Versprechen, am 14. August, kamen die offenen Gewichte für Qwen3.8-Max, zusammen mit etwas, das die frühere Ankündigung nicht erwähnt hatte: Qwen3.8-27B, ein dichtes Modell mit 27,78 Milliarden Parametern, gebaut genau für den Einsatzfall, den die Max-Variante ausschließt - eine einzelne handelsübliche GPU.

Was die Benchmarks tatsächlich zeigen

Alibabas eigene Modellkarte vergleicht Qwen3.8-27B mit Qwen3.6-27B, seinem direkten Vorgänger bei derselben Parameterzahl - der ehrliche Vergleich, um Generationsfortschritt zu beurteilen, statt Größenklassen gegeneinander zu stellen. Terminal-Bench 2.1, das prüft, ob ein Modell reale Kommandozeilenaufgaben erledigen kann, stieg von 63,4 auf 73,0. DeepSWE 1.1, ein Software-Engineering-Benchmark, verdreifachte sich fast von 13,3 auf 42,2. OSWorld-Verified, das die Erledigung von Aufgaben in einer echten Desktop-Umgebung bewertet, stieg von 63,9 auf 84,3. JobBench, das professionelle Aufgabenerfüllung statt Coding-Rätsel bewertet, stieg von 21,8 auf 33,4 - ein Sprung von rund 50 Prozent.

Keine dieser Zahlen macht ein Modell mit 27 Milliarden Parametern gleichwertig zur Max-Variante mit 2,4 Billionen Parametern, die am selben Tag erschien. Sie zeigen aber, dass ein Modell, das klein genug für eine einzelne GPU ist, inzwischen Aufgaben erledigt, für die vor einem Jahr noch ein deutlich größeres Modell nötig war. Das ist die eigentliche Geschichte: Die Schwelle dafür, was als wirklich nützliches lokales Modell zählt, sinkt beim Hardwarebedarf immer weiter, während die Benchmark-Werte weiter steigen.

Warum das die Selbsthosting-Entscheidung zweiteilt

Vor zwei Wochen war die ehrliche Antwort auf die Frage eines EU- oder UK-Anbieters, ob man Qwen selbst hosten sollte, ein klares Nein - außer das Unternehmen betrieb bereits eine Multi-GPU-Serverinfrastruktur -, weil der Speicherbedarf des Flaggschiffmodells alles Kleinere ausschloss. Diese Antwort hat sich für die Max-Variante nicht geändert. Für die 27B-Variante hat sie sich vollständig geändert: Sie passt mit Speicherreserve auf eine einzelne Gaming-GPU, dieselbe Hardwareklasse, die ein mittelgroßes Engineering-Team möglicherweise ohnehin schon für andere Zwecke besitzt.

Die praktische Folge: Selbsthosting ist nicht mehr eine Entscheidung, die ein Unternehmen einmal trifft. Es ist jetzt eine Entscheidung pro Workload, pro Modellgröße, innerhalb derselben Familie. Ein Team, das Reasoning auf Frontier-Niveau über große Dokumentmengen braucht, benötigt weiterhin die Max-Variante samt dem dazugehörigen Multi-GPU-Budget. Ein Team, das einen fähigen Coding- oder Aufgaben-Assistenten für interne Werkzeuge braucht, kann die 27B-Variante jetzt womöglich auf bereits vorhandener Hardware betreiben - zu einem Bruchteil der Kosten eines API-Abonnements bei gleicher Nutzung.

Was vor dem erneuten Abschreiben von Selbsthosting zu prüfen ist

Wenn Ihr Team eine Selbsthosting-Bewertung nach der Ankündigung vom 3. August ad acta gelegt hat, weil die Speicherrechnung nicht aufging, lohnt es sich, diese gezielt mit der 27B-Variante neu durchzurechnen - nicht mit der Max-Variante. Prüfen Sie drei Dinge: ob Ihr tatsächlicher Workload Reasoning auf Max-Niveau braucht oder von einem Modell mit 27 Milliarden Parametern gut bedient wäre, was eine einzelne leistungsfähige GPU im Vergleich zu einem Jahr API-Ausgaben bei Ihrer aktuellen Nutzung kostet, und ob Ihre Anforderungen an den Datenstandort der eigentliche Grund fürs Selbsthosting sind - dann ist die Hardwarekosten-Frage dem Compliance-Nutzen ohnehin nachgeordnet. Die beiden Zahlen, 2,4 Terabyte und eine GPU, beschreiben dieselbe Qwen-Veröffentlichung. Welche für Sie gilt, hängt allein davon ab, welche Größe Sie tatsächlich brauchen.