750 jetons par seconde, en aperçu limité
OpenAI et Cerebras ont annoncé le mode Ultrafast pour GPT-5.6 Sol le 13 août 2026, générant jusqu'à 750 jetons de sortie par seconde, jusqu'à 14 fois plus rapide que le traitement standard du modèle, selon l'annonce d'OpenAI elle-même concernant cet aperçu. Le palier n'est pour l'instant disponible que pour un groupe restreint de clients pendant qu'OpenAI évalue comment cette vitesse supplémentaire change les produits réels; d'autres entreprises peuvent s'inscrire sur une liste d'attente en soumettant les détails de leur charge de travail. Le chercheur d'OpenAI Jeffrey Wang a décrit l'effet pratique dans les propres documents de l'entreprise: 'Cela se termine maintenant avant même que j'aie l'occasion de changer de contexte. Cela me rend bien plus productif.'
OpenAI cite les interfaces vocales, le support client, le commerce, les agents pour développeurs, la recherche financière et la réponse aux incidents de sécurité comme cas d'usage visés, et affirme que ses propres développeurs ont utilisé l'aperçu pour analyser des journaux et des traces pendant des incidents, et pour comprimer des cycles de recherche qui tournaient auparavant toute la nuit en plusieurs itérations au cours d'une seule journée de travail. GPT-5.6 Sol lui-même a été lancé en juin 2026 aux côtés des variantes Terra (équilibrée) et Luna (axée vitesse), et est devenu largement disponible sur ChatGPT, Codex et l'API en juillet.
La puce qui fait le travail n'est pas celle de Nvidia
Le gain de vitesse provient de la Wafer-Scale Engine de Cerebras, qui conserve les poids complets d'un modèle directement sur la puce, répartis sur 44 gigaoctets de SRAM intégrés dans chaque processeur de la taille d'une tranche de silicium, selon le billet de blog de Cerebras consacré au partenariat. Cela élimine les transferts répétés entre la mémoire et le calcul qui créent de la latence sur les clusters de GPU classiques, laissant les jetons circuler sans interruption à travers des couches de modèle organisées en pipeline et réparties sur plusieurs tranches - une conception pensée pour s'adapter à mesure que les modèles grossissent, selon la description technique propre à Cerebras.
Cerebras présente cette architecture depuis des années comme une alternative plus rapide, quoique moins flexible, aux clusters de GPU de Nvidia pour les charges de travail d'inférence, mais ses partenariats publics les plus en vue jusqu'ici penchaient plutôt vers des laboratoires plus petits ou de taille intermédiaire que vers le plus gros acheteur individuel de capacité Nvidia de tout le secteur. Les engagements d'infrastructure propres d'OpenAI envers Nvidia se chiffrent en centaines de milliards de dollars, une relation que ce média a déjà couverte en détail, ce qui fait du choix d'acheminer même un palier d'aperçu limité via une architecture de puce concurrente un fait notable, plutôt qu'une simple diversification de fournisseurs de routine.
Ce que la vitesse achète réellement
Sur GDP-Val, un banc d'essai construit autour de tâches de travail économiquement utiles, OpenAI rapporte une accélération de bout en bout de 5,6 fois sans perte de qualité mesurée. Sur Humanity's Last Exam, un test de 2500 questions de niveau doctorat, GPT-5.6 Sol Ultrafast a terminé l'ensemble complet en 11 heures 11 minutes contre 78 heures 27 minutes pour Claude Fable 5, selon la comparaison publiée par Cerebras elle-même, soit environ sept fois plus rapide sur ce banc d'essai précis, aux côtés des affirmations distinctes de Cerebras d'un débit 11 fois supérieur à Claude Fable 5 et 5 fois supérieur au mode rapide de Claude Opus 4.8.
Rien de tout cela ne rend GPT-5.6 Sol plus intelligent. C'est le même modèle, qui répond de la même façon, seulement plus vite, ce qui compte spécifiquement pour les charges de travail où la latence elle-même est le goulot d'étranglement plutôt que la qualité du raisonnement: un agent de support qu'un client n'attendra pas, une réponse de sécurité qui doit intervenir en plein incident actif, ou un modèle financier qui doit faire tourner plusieurs scénarios avant la clôture du marché.
Une couverture contre Nvidia, même pour OpenAI
La leçon pratique ici n'est pas que Cerebras a battu Nvidia sur un banc d'essai. C'est que l'entreprise la plus imbriquée financièrement avec l'expansion IA de Nvidia avait tout de même une raison commerciale de faire tourner son palier de produit le plus critique en matière de latence sur une architecture de puce différente, parce que la physique consistant à garder les poids sur la puce l'emporte sur la physique consistant à les déplacer à travers un cluster de GPU pour cette tâche précise. Toute entreprise européenne qui construit une stratégie d'infrastructure IA de long terme autour d'un seul fournisseur de calcul, aussi dominant que ce fournisseur paraisse aujourd'hui, devrait y voir la preuve que même les plus gros clients se couvrent quand une charge de travail précise l'exige.
Il s'agit d'un aperçu limité sans tarification publiée, pas d'une décision de produit générale sur laquelle les entreprises doivent agir immédiatement. Le geste utile n'est pas de changer de fournisseur sur la foi d'une seule annonce, mais de le noter comme un élément à suivre: repérer lesquelles de vos propres charges de travail sont réellement limitées par la latence plutôt que par le raisonnement, car ce sont celles pour lesquelles une seconde option d'infrastructure, et pas seulement un second contrat cloud, pourrait à terme valoir la complexité supplémentaire.
À lire ensuite: AMD a cédé la moitié de l'inférence à une puce rivale | Louer l'IA de frontière est désormais un choix, pas une obligation



