La semaine où une jeune pousse a lâché son fournisseur de pointe
Andy Fang, cofondateur de DoorDash, a décrit l'usage de Moonshot AI pour un outil expérimental en ligne de commande en termes commerciaux simples: meilleure qualité à moindre coût. Cursor a utilisé le modèle Kimi de Moonshot pour construire son agent de codage Composer 2. La jeune pousse Lindy aurait abandonné complètement les outils d'Anthropic au profit des modèles V4 de DeepSeek. Airbnb et Siemens expérimentent toutes deux des systèmes d'Alibaba et de DeepSeek pour contenir le coût des opérations quotidiennes. Aucune de ces décisions n'est idéologique. Ce sont des décisions d'achat, prises charge de travail par charge de travail.
L'ampleur se lit dans les données de routage. Sur OpenRouter, la place de marché par laquelle transite une large part du trafic vers les modèles, les entreprises américaines ont envoyé plus de 30 pour cent de leur consommation de jetons vers des modèles chinois chaque semaine depuis le 8 février, avec une semaine de pointe à 46 pour cent. Au premier semestre 2025, ce même chiffre était de 4,5 pour cent. Une étude de Hugging Face en mars 2026 a établi que les modèles chinois en source ouverte représentaient 41 pour cent des téléchargements sur cette plateforme. L'écart de prix qui alimente le mouvement n'est pas marginal: les systèmes chinois coûtent en règle générale 60 à 90 pour cent de moins que les principaux modèles américains, et sur certains paliers l'écart est plus large encore.
Ce qui en fait une histoire de décision plutôt qu'une histoire de marché, c'est l'identité de ceux qui ont capté l'économie. Les entreprises citées n'ont pas basculé parce qu'elles ont découvert ce trimestre un fournisseur moins cher. Elles ont basculé parce qu'elles en étaient déjà capables. Chez chacune, quelqu'un avait construit la capacité de faire tourner la même charge sur un autre modèle et de voir, en chiffres, si le résultat tenait.
L'option de basculer s'achète bien avant qu'elle ne rapporte
La plupart des entreprises européennes se sont standardisées sur un fournisseur de pointe unique en 2024 et 2025, pour des raisons défendables: un contrat, une revue de sécurité, une intégration, un seul jeu d'instructions à maintenir. Le coût de cette décision est resté invisible tant que les prix étaient stables. Il est devenu visible dès qu'un écart de 60 pour cent s'est ouvert, car une entreprise avec un seul fournisseur et sans banc d'essai ne peut pas savoir si un modèle moins cher est assez bon pour son propre trafic, et aucun comparatif fourni par un vendeur ne répond à cette question à sa place.
C'est la forme classique d'une option que l'on ignorait avoir vendue. La standardisation est une vraie efficacité, et elle est correctement valorisée dans un monde où les alternatives se valent. Quand l'écart s'élargit, l'entreprise qui a conservé un moyen de tester convertit cet écart en marge, l'autre le regarde passer. L'asymétrie ne tient pas à l'intelligence. Elle tient à qui a payé d'avance un coût modeste et ennuyeux, et ici le coût ennuyeux est un jeu d'évaluation figé: quelques centaines de requêtes tirées de votre trafic réel, avec des réponses attendues notées, contre lequel tout modèle candidat peut être passé en une après-midi.
Résistez au réflexe de tout router. Le schéma décrit est sélectif et non massif. Les équipes envoient le travail à fort volume et faible enjeu au modèle le moins cher qui franchit la barre, et laissent le travail à forte part de jugement là où il était. C'est la bonne forme, et la raison tient aux taux de base: un modèle qui égale un système de pointe sur 95 pour cent de vos requêtes peut être nettement moins bon sur les 5 pour cent qui produisent réclamations, remboursements ou exposition juridique. Segmentez par conséquence de l'erreur avant de segmenter par prix.
Pourquoi la version européenne est un autre calcul
Une entreprise américaine qui choisit un modèle chinois choisit en général une API. Une entreprise européenne qui fait le même choix nominal se heurte à une question absente de la comparaison de prix: où part la requête, et sur quelle base de transfert. Envoyer des données clients vers une API de modèle hébergée hors de l'Union est une question de transfert assortie d'obligations documentaires, et pour des charges réglementées la réponse est souvent que l'API bon marché ne vous est tout simplement pas accessible.
La voie qui fonctionne ne figure pas dans les grilles tarifaires. La plupart des systèmes chinois évoqués ici sont à poids ouverts, ce qui signifie que vous pouvez les exécuter sur une infrastructure que vous contrôlez, dans votre propre périmètre, sans qu'aucune requête ne sorte de votre parc. Yasir Atalan, du CSIS, a résumé l'attrait sans détour: les modèles en source ouverte soulagent ceux qui veulent garder leurs données. Mais cette voie transforme une facture au jeton en une structure de coûts entièrement différente: de la capacité GPU à acheter ou à louer, une pile d'inférence que quelqu'un doit exploiter, et le personnel pour maintenir les deux en bon état. À volume, cela peut rester bien moins cher. C'est une décision fondamentalement autre que le changement d'une clé d'API, et elle relève d'une discussion d'investissement plutôt que d'achats.
La comparaison utile est donc à trois branches et non à deux. API de pointe, API moins chère et poids ouverts auto-hébergés portent chacun une courbe de coûts, une posture de données et un mode de défaillance différents. Passez les trois sur le même jeu d'évaluation avec votre propre trafic, y compris le volume à partir duquel l'auto-hébergement devient rentable, et vous aurez de quoi faire agir un conseil. N'en passez aucun, et les 60 pour cent des titres resteront une économie que d'autres entreprises encaissent.
À lire ensuite: Deux géants de l'IA se font intégrateurs | Cadence et Synopsys ont réglé leurs outils pour Nvidia



