Schanghai beantwortet die im Juli ausgelassene Frage

Am 3. August hat Alibaba Qwen3.8-Max veröffentlicht, jenes Modell, das am 19. Juli auf der World AI Conference in Schanghai ohne die entscheidenden Zahlen vorgestellt worden war. Die Spezifikation liegt nun offen: 2,4 Billionen Parameter insgesamt, davon 95 Milliarden bei der Inferenz aktiv, aufgebaut auf der Qwen-3.5-Architektur und in der Lage, Text, Bilder, Video und Dokumente in einem System zu verarbeiten. Die in Hongkong notierte Aktie stieg im frühen Handel um etwa 6 Prozent auf 124,00 Hongkong-Dollar.

Zugleich legte sich das Unternehmen bei dem Punkt fest, den es im Juli nicht datieren wollte. Die Gewichte sollen nächste Woche offen veröffentlicht werden, womit dies das erste Max-Modell von Qwen wäre, das jeder herunterladen und auf eigener Hardware betreiben kann. Für europäische Unternehmen, die chinesische Spitzenmodelle gerade deshalb beobachten, weil offene Gewichte Selbsthosting, Prüfung und Ausstieg erlauben, ist das der folgenreiche Teil der Ankündigung.

95 Milliarden aktive Parameter sind die eigentlich gute Nachricht

Warum das zählt: Die Aktivierungsrate verwandelt eine Parameterzahl in eine Rechnung. Qwen3.8-Max beansprucht pro Anfrage etwa 4 Prozent seines Netzes, der Rechenaufwand je Anfrage liegt damit näher an einem Modell mit 95 Milliarden Parametern als an einem mit 2,4 Billionen. Alibaba beziffert die Inferenzkosten niedriger als in der Vorgängergeneration, und die offengelegte Architektur stützt diese Aussage ausnahmsweise, statt sie zu verschleiern.

Es ist genau die Zahl, die in der Juli-Vorschau fehlte, und sie fällt günstig aus. Wer Token über eine Schnittstelle einkauft, sollte daraus schließen, dass ein mit 2,4 Billionen Parametern beworbenes Modell nicht wie ein solches bepreist werden darf. Die Vorschau läuft weiterhin zu 10 Prozent des Standardtarifs über Token Plan, Qoder und QoderWork, und der Vorgänger Qwen3.7-Max ist mit 2,50 US-Dollar je Million Eingabe-Token und 7,50 je Million Ausgabe-Token gelistet, etwa 2,30 und 6,90 Euro. Bewerten Sie jedes Angebot an dieser Liste, niemals am Aktionspreis.

Dann zählen Sie den Speicher, nicht die Parameter

Die Zahl, die in keiner Überschrift stand: 2,4 Billionen Parameter zu halten erfordert bei 8-Bit-Präzision rund 2,4 Terabyte Speicher und etwa 1,2 Terabyte, wenn Sie auf 4 Bit quantisieren und den Qualitätsverlust hinnehmen. Ein Server mit acht H200-Grafikprozessoren bietet insgesamt rund 1,1 Terabyte Hochgeschwindigkeitsspeicher. Offene Gewichte dieser Größe bedeuten also keinen einzelnen Server. Sie bedeuten mindestens zwei vollständige Knoten bei 8 Bit oder eine knappe Passung auf einem Knoten nach aggressiver Quantisierung, bevor auch nur ein Byte für den Schlüssel-Wert-Zwischenspeicher reserviert ist, der die gleichzeitigen Nutzer tatsächlich bedient.

Das trifft auf den denkbar schlechtesten Monat. Speicher ist derzeit der knappste Rohstoff der Branche: Rund 70 Prozent des Angebots für das kommende Jahr sind bereits vergeben, die Vertragspreise für DRAM und HBM sind das ganze Quartal über gestiegen, und die Engpässe reichen so weit nach unten, dass Apple ein Einstiegsnotebook nicht lieferbar halten kann und Käufer auf ein teureres Gerät lenkt. Die Freiheit offener Gewichte ist echt, für die meisten europäischen Betreiber bleibt sie vorerst theoretisch. Man überreicht Ihnen die Schlüssel zu einem Gebäude, dessen Fläche Sie nicht mieten können.

Die Benchmark-Aussage bleibt Alibaba, das Alibaba bewertet

Alibaba erklärt, das Modell sei mit den führenden amerikanischen Systemen weitgehend konkurrenzfähig, übertreffe sie bei mehreren Programmier-, Multimodal- und Engineering-Tests und liege bei einigen allgemeinen Reasoning-Tests zurück; erneut ordnet sich das Unternehmen knapp hinter Anthropics Fable 5 ein. Jede dieser Einordnungen stammt aus Alibabas eigenem Veröffentlichungsmaterial. Keine unabhängige Rangliste hat Qwen3.8-Max bisher bewertet, genau wie zuvor bei der Juli-Vorschau.

Aber: Die Freigabe der Gewichte verändert das Gewicht dieses Vorbehalts, statt ihn aufzuheben. Sind die Gewichte öffentlich, hängt unabhängige Bewertung nicht mehr vom Wohlwollen des Anbieters oder vom Schnittstellenzugang ab, und eine Rangbehauptung wird binnen Tagen von jedem widerlegbar, der die Hardware zum Laden besitzt. Ein Anbieter, der seine Gewichte eine Woche nach einer Rangbehauptung öffnet, ist zumindest bereit, sich prüfen zu lassen. Die richtige Reaktion ist, diese Prüfung abzuwarten, die nun Tage statt unbestimmter Zeit entfernt ist.

Was sich für europäische Käufer in diesem Monat ändert

An Ihrem Produktivsystem vorerst nichts. Die sinnvolle Reihenfolge ist eng gefasst: die Gewichte abwarten, die unabhängigen Bewertungen abwarten, dann auf der eigenen Arbeitslast zum vollen Listenpreis statt zum Vorschautarif prüfen. Das ist eine Entscheidung für September, nicht für August, und es kostet nichts, bei einem Modell Zweiter zu sein, das in sechs Wochen noch da ist.

Unter dem Strich: Die strategische Frage dieser Veröffentlichung lautet nicht, ob ein chinesisches Modell gut genug ist. Sie lautet, ob offene Gewichte noch Unabhängigkeit erkaufen, wenn die Hardware zu ihrer Nutzung rationiert ist. Wenn Selbsthosting überhaupt Ihr Grund ist, diese Veröffentlichungen zu verfolgen, hat sich die bindende Beschränkung still von den Lizenzbedingungen zur Speicherbeschaffung verschoben, und dorthin gehört jetzt die Planungsarbeit.