Même famille, mêmes deux semaines, facture matérielle opposée

Le 3 août, Alibaba a annoncé Qwen3.8-Max : 2,4 billions de paramètres au total, environ 95 milliards actifs par requête, et la promesse que les poids ouverts suivraient sous une semaine. Ce média avait couvert cette annonce à l'époque et calculé ce que l'auto-hébergement coûterait vraiment : environ 2,4 téraoctets de mémoire pour contenir le modèle complet en précision 8 bits, plus que ce qu'offre un seul nœud à huit GPU H200, en pleine pénurie de mémoire à l'échelle du secteur, qui poussait déjà les prix des composants à la hausse.

Onze jours après la promesse initiale d'une semaine, le 14 août, les poids ouverts de Qwen3.8-Max sont arrivés, accompagnés de quelque chose que l'annonce précédente n'avait pas mentionné : Qwen3.8-27B, un modèle dense de 27,78 milliards de paramètres construit précisément pour le cas d'usage que la variante Max exclut, un seul GPU grand public.

Ce que montrent vraiment les benchmarks

La fiche modèle d'Alibaba compare Qwen3.8-27B à Qwen3.6-27B, son prédécesseur direct au même nombre de paramètres, ce qui est la comparaison honnête pour juger du progrès générationnel plutôt que de comparer des tailles différentes. Terminal-Bench 2.1, qui teste si un modèle peut accomplir de vraies tâches en ligne de commande, est passé de 63,4 à 73,0. DeepSWE 1.1, un benchmark d'ingénierie logicielle, a plus que triplé, de 13,3 à 42,2. OSWorld-Verified, qui mesure l'accomplissement de tâches dans un vrai environnement de bureau, est passé de 63,9 à 84,3. JobBench, qui mesure l'accomplissement de tâches professionnelles plutôt que des énigmes de code, est passé de 21,8 à 33,4, un bond de près de 50 pour cent.

Aucun de ces chiffres ne rend un modèle de 27 milliards de paramètres équivalent à la variante Max de 2,4 billions sortie le même jour. Ils signifient en revanche qu'un modèle assez petit pour tourner sur un seul GPU accomplit aujourd'hui des tâches pour lesquelles un modèle bien plus grand était nécessaire il y a un an, et c'est là la vraie histoire : le plancher de ce qui compte comme un modèle local vraiment utile continue de baisser en exigence matérielle, tandis que les scores de benchmark continuent de grimper.

Pourquoi cela divise en deux la décision d'auto-hébergement

Il y a deux semaines, la réponse honnête à un propriétaire de l'UE ou du Royaume-Uni demandant s'il fallait auto-héberger Qwen était un non catégorique, sauf si l'entreprise exploitait déjà une infrastructure serveur multi-GPU, parce que l'empreinte mémoire du modèle phare excluait tout ce qui était plus petit. Cette réponse n'a pas changé pour la variante Max. Elle a complètement changé pour la variante de 27 milliards, qui tient avec de la marge sur un seul GPU gaming, la même classe de matériel qu'une équipe d'ingénierie de taille moyenne possède peut-être déjà pour d'autres usages.

La conséquence pratique est que l'auto-hébergement n'est plus une décision qu'une entreprise prend une seule fois. C'est désormais une décision par charge de travail, par taille de modèle, au sein d'une même famille. Une équipe qui a besoin d'un raisonnement de pointe sur de gros volumes de documents a toujours besoin de la variante Max et du budget multi-GPU qui va avec. Une équipe qui a besoin d'un assistant capable de coder ou d'accomplir des tâches pour des outils internes peut désormais faire tourner la variante de 27 milliards sur du matériel qu'elle possède déjà, pour une fraction du coût d'un abonnement API à la même échelle d'usage.

Ce qu'il faut vérifier avant d'écarter à nouveau l'auto-hébergement

Si votre équipe a mis de côté une évaluation d'auto-hébergement après l'annonce du 3 août parce que le calcul mémoire ne fonctionnait pas, cela vaut la peine de le refaire spécifiquement avec la variante de 27 milliards, pas avec la variante Max. Vérifiez trois choses : si votre charge de travail réelle a besoin d'un raisonnement de classe Max ou serait bien servie par un modèle de 27 milliards de paramètres, ce que coûte un seul GPU capable face à une année de dépense API à l'usage actuel de votre équipe, et si vos exigences de résidence des données sont la vraie raison de l'auto-hébergement, auquel cas le coût matériel devient secondaire face au bénéfice de conformité. Les deux chiffres, 2,4 téraoctets et un GPU, décrivent la même publication Qwen. Celui qui s'applique à vous dépend entièrement de la taille dont vous avez vraiment besoin.