Les chiffres publiés par OpenAI
OpenAI a profité de la conférence Hot Chips 2026 du 25 août pour publier les premiers résultats de benchmark de Jalapeno, la puce d'inférence développée avec Broadcom en environ neuf mois. Sur le benchmark InferenceX de SemiAnalysis, testé sur trois modèles, GPT-OSS-120B, DeepSeek R1 et Kimi K2.5, Jalapeno a fourni 1,5 à 1,9 fois plus de travail d'IA par watt que la GB300 de Nvidia, et a réduit la latence de bout en bout de 1,7 à 3,6 fois, jusqu'à 2,1 à 4,1 fois sur les charges les plus interactives.
La puce affiche une puissance nominale de 700 watts, mais est restée à 550 watts ou moins sur les charges testées. Un seul rack de 128 puces délivre 1,7 exaflops de calcul en 4 bits ainsi que 27,5 téraoctets de mémoire HBM4, et un pod complet monte jusqu'à 2 048 puces. OpenAI prévoit un déploiement en petit volume d'ici fin 2026, avec une montée en charge sur 2027.
| Indicateur | L'affirmation d'OpenAI |
|---|---|
| Travail par watt | 1,5 à 1,9 fois plus que la Nvidia GB300 |
| Latence de bout en bout | 1,7 à 3,6 fois inférieure à la Nvidia GB300 |
| Puissance nominale | 700 watts, en test 550 watts ou moins |
| Calendrier de déploiement | Petit volume d'ici fin 2026, montée en charge en 2027 |
Pourquoi un chiffre en watts pèse plus lourd en Europe que le titre ne le suggère
Un gain d'efficacité réel de cette ampleur importerait bien au-delà des propres centres de données d'OpenAI, car il arrive en plein débat européen sur la capacité du réseau électrique à soutenir l'expansion de l'IA. Le gestionnaire de réseau irlandais a gelé les nouveaux raccordements de data centers autour de Dublin jusqu'en 2028, et les pics de prix spot en Hongrie rapportés cette semaine montrent à quel point la capacité d'interconnexion européenne est déjà tendue ; une puce qui nécessiterait vraiment 40 pour cent d'énergie en moins par unité de travail d'IA serait exactement le soulagement pour ce goulot d'étranglement.
L'écart, c'est qu'en dehors d'OpenAI, personne n'a encore refait la comparaison. Le benchmark a utilisé la sélection de modèles propre d'OpenAI, le choix propre d'OpenAI de comparer avec la GB300 plutôt qu'avec la génération plus récente Vera Rubin de Nvidia, et aucun résultat de laboratoire indépendant n'a été publié à côté.
Que faire d'un chiffre venant du fournisseur lui-même
Traitez-le comme n'importe quelle équipe d'achats devrait traiter un benchmark exécuté par le fournisseur : une information réelle, à suivre, mais pas encore une donnée de planification. Les données d'efficacité indépendantes arrivent généralement via les résultats d'inférence MLPerf ou des tests de laboratoire tiers équivalents sur du matériel que le fournisseur ne contrôle pas, et aucun des deux n'existe encore pour Jalapeno.
Pour tout planificateur d'infrastructure, gestionnaire de réseau ou fournisseur d'énergie dans l'UE qui reçoit une demande de raccordement citant l'efficacité d'une nouvelle génération de puces comme justification de capacité, la bonne réaction est de demander quel benchmark soutient le chiffre et qui l'a exécuté, et non d'accepter une diapositive du fournisseur comme substitut à un test indépendant.
À lire ensuite: La taxe Nvidia a désormais une seconde source | 74 Serveurs IA Sur 130 Ont Atteint La Chine



