Shanghai a répondu à la question esquivée en juillet

Le 3 août, Alibaba a lancé Qwen3.8-Max, le modèle présenté le 19 juillet à la World AI Conference de Shanghai sans les chiffres qui comptaient. La spécification est désormais publique : 2 400 milliards de paramètres au total, dont 95 milliards actifs à l'inférence, bâti sur l'architecture Qwen 3.5 et capable de traiter texte, images, vidéo et documents dans un même système. L'action cotée à Hong Kong a gagné près de 6 pour cent, à 124,00 dollars de Hong Kong, dès les premiers échanges.

L'entreprise s'est aussi engagée sur le point qu'elle refusait de dater en juillet. Les poids seront publiés en accès ouvert la semaine prochaine, ce qui en ferait le premier modèle Max de Qwen que chacun peut télécharger et exécuter sur du matériel qu'il maîtrise. Pour une entreprise européenne qui surveille les modèles chinois précisément parce que les poids ouverts autorisent l'hébergement, l'inspection et la sortie, c'est la partie de l'annonce qui porte à conséquence.

Les 95 milliards actifs sont la vraie bonne nouvelle

Pourquoi c'est important : le taux d'activation est ce qui transforme un nombre de paramètres en facture. Qwen3.8-Max mobilise environ 4 pour cent de son réseau à chaque requête, si bien que le calcul consommé par appel se rapproche d'un modèle de 95 milliards de paramètres plutôt que de 2 400 milliards. Alibaba situe les coûts d'inférence en dessous de la génération précédente et, pour une fois, l'architecture divulguée appuie l'affirmation au lieu de la brouiller.

C'est exactement le chiffre qui manquait à l'aperçu de juillet, et il arrive du bon côté. Pour qui achète des jetons via une interface, la lecture pratique est qu'un modèle vendu sur 2 400 milliards de paramètres ne doit pas être facturé comme tel. L'aperçu reste à 10 pour cent du tarif standard via Token Plan, Qoder et QoderWork, et le précédent Qwen3.7-Max est affiché à 2,50 dollars par million de jetons en entrée et 7,50 par million en sortie, environ 2,30 et 6,90 euros. Jugez toute offre à l'aune de ce tarif public, jamais du prix promotionnel.

Comptez ensuite la mémoire, pas les paramètres

Le chiffre que personne n'a mis en titre : contenir 2 400 milliards de paramètres réclame environ 2,4 téraoctets de mémoire en précision 8 bits, et près de 1,2 téraoctet si vous quantifiez en 4 bits en acceptant la perte de qualité. Un serveur à huit processeurs graphiques H200 fournit au total environ 1,1 téraoctet de mémoire à haute bande passante. Des poids ouverts de cette taille ne signifient donc pas un serveur. Ils signifient au moins deux nœuds complets en 8 bits, ou un ajustement serré sur un nœud après quantification agressive, avant même d'avoir réservé un seul octet au cache clé-valeur qui sert réellement les utilisateurs simultanés.

Cela tombe au pire moment possible. La mémoire est aujourd'hui l'intrant le plus rare du secteur : près de 70 pour cent de l'offre de l'an prochain est déjà engagée, les prix contractuels de la DRAM et de la HBM ont grimpé tout le trimestre, et la tension descend si bas qu'Apple n'arrive plus à garder en stock un portable d'entrée de gamme et oriente les acheteurs vers un modèle plus cher. La liberté qu'accordent les poids ouverts est réelle et, pour la plupart des entreprises européennes, elle reste théorique. On vous remet les clés d'un bâtiment dont vous ne pouvez pas louer la surface.

L'affirmation de performance reste Alibaba qui mesure Alibaba

Alibaba affirme que le modèle rivalise globalement avec les grands systèmes américains, qu'il les devance sur plusieurs tests de programmation, de multimodal et d'ingénierie, et qu'il reste en retrait sur certaines épreuves de raisonnement général, en se plaçant de nouveau juste derrière le Fable 5 d'Anthropic. Chacun de ces placements provient du matériel de lancement d'Alibaba elle-même. Aucun classement indépendant n'a encore noté Qwen3.8-Max, exactement comme pour l'aperçu de juillet.

Oui, mais : l'ouverture des poids modifie le poids de cette réserve au lieu de la lever. Une fois les poids publics, l'évaluation indépendante cesse de dépendre de la bonne volonté du fournisseur ou de l'accès à l'interface, et une affirmation de classement devient réfutable en quelques jours par quiconque possède la machine pour la charger. Un fournisseur qui ouvre ses poids une semaine après avoir revendiqué un rang accepte au moins d'être contrôlé. La bonne réaction est d'attendre ce contrôle, désormais à quelques jours et non à échéance indéterminée.

Ce que cela change ce mois-ci pour un acheteur européen

Rien dans votre système en production, pour l'instant. La séquence à suivre est étroite : laissez arriver les poids, laissez arriver les évaluations indépendantes, puis testez sur votre propre charge de travail au tarif public complet et non au tarif d'essai. C'est une décision de septembre et non d'août, et arriver deuxième sur un modèle qui sera encore là dans six semaines ne coûte rien.

En résumé : la question stratégique posée par ce lancement n'est pas de savoir si un modèle chinois est assez bon. Elle est de savoir si les poids ouverts achètent encore de l'indépendance quand le matériel nécessaire pour l'exercer est rationné. Si l'hébergement autonome est votre raison de suivre ces sorties, la contrainte déterminante s'est déplacée sans bruit des conditions de licence vers l'approvisionnement en mémoire, et c'est là que doit désormais porter l'effort de planification.