Les deux lignes de la grille tarifaire

La page publique de tarifs de xAI affiche en ce moment les deux versions de son modèle voix à voix côte à côte, ce qui est la façon la plus nette de voir ce qui arrive. Grok Voice Think Fast 1.0 y figure à 0,05 dollar la minute d'audio, soit 3,00 dollars l'heure, plus 0,004 dollar pour l'entrée texte. Grok Voice Think Fast 2.0 y figure à 0,08 dollar la minute, soit 4,80 dollars l'heure, avec la même ligne pour le texte. Même catégorie de produit, même fournisseur, même page, un écart de 60 pour cent entre deux lignes.

La date se trouve dans la note de version du 29 juillet. xAI y consigne que grok-voice-think-fast-2.0 est désormais disponible avec Speech to Speech et que grok-voice-latest pointera vers ce modèle à compter du 5 août 2026. La consigne de migration de l'entreprise elle-même précise qu'aucune action n'est nécessaire pour effectuer la mise à niveau et que quiconque souhaite rester sur l'ancien modèle doit épingler grok-voice-think-fast-1.0 avant cette date. Lisez ces deux phrases ensemble et la forme de la semaine apparaît: l'option la moins chère existe toujours, et ce n'est pas celle que l'on obtient en laissant son code tranquille.

Ce que la mise à niveau améliore vraiment

Rien ici ne relève du fournisseur qui facture davantage pour moins. Sur le comparatif indépendant voix à voix d'Artificial Analysis, Think Fast 2.0 a obtenu 82,9 pour cent contre 75,7 pour cent pour la version 1.0. Le délai avant le premier son, ce silence que l'appelant entend avant que le modèle ne se mette à parler, est passé de 1,25 à 0,70 seconde. L'usage relatif médian de jetons de raisonnement est descendu à 0,4 fois celui du prédécesseur, parce que le nouveau modèle raisonne en parallèle de la parole au lieu de réfléchir d'abord et de parler ensuite. La précision de transcription progresse également. Selon toutes les mesures publiées, c'est un meilleur modèle dont l'exploitation coûte moins cher à son fabricant.

C'est cette dernière proposition qui est intéressante. Un modèle qui consomme 60 pour cent de jetons de raisonnement en moins et répond en environ moitié moins de temps coûte moins cher à servir, et sur le marché du texte ce fait parvient au client en quelques semaines. Il est parvenu aux clients d'OpenAI le 30 juillet, lorsque l'entreprise a réduit GPT-5.6 Luna de 80 pour cent et Terra de 20 pour cent en attribuant ce geste à la baisse de ses propres coûts de service. Ici, la même catégorie d'amélioration est arrivée assortie d'une hausse de 60 pour cent. Rien de malhonnête là-dedans. C'est la conséquence directe de l'unité que compte le compteur.

Pourquoi un meilleur modèle coûte davantage ici

Le texte et la voix se vendent sur des horloges différentes, et cet écart décide qui conserve l'efficacité. Le texte se facture au jeton, qui mesure le travail accompli. Lorsqu'un modèle a besoin de moins de jetons pour parvenir à la même réponse, votre facture baisse sans que personne ait à le décider, puisque vous achetez des unités de calcul et qu'il vous en faut désormais moins. La voix se facture à la minute d'audio, qui mesure le temps écoulé. Un appelant qui explique un problème de livraison met les mêmes quatre-vingt-dix secondes que le modèle au bout du fil soit rapide ou lent, si bien que le nombre d'unités facturables est fixé par la parole humaine et non par l'efficacité du modèle.

La conséquence est que la voix est la seule ligne d'un budget d'IA qui, structurellement, ne peut pas profiter de la course à l'efficacité, et c'est aussi celle qui croît avec vos clients plutôt qu'avec votre ingénierie. Toute amélioration apportée par votre fournisseur à un produit facturé au jeton finit par se traduire par une facture plus faible. Toute amélioration d'un produit facturé à la minute se traduit par un meilleur produit au prix que fixe le fournisseur, et l'économie reste là où elle a été réalisée. Un dirigeant qui voit les prix des modèles chuter toute l'année peut raisonnablement supposer que l'IA se déprécie partout. C'est le compteur, non le modèle, qui décide si c'est vrai pour une charge donnée.

L'arithmétique sur votre propre volume d'appels

Posez de vrais chiffres à côté, car le pourcentage sous-estime la vitesse à laquelle cela s'accumule. Un appel de quatre minutes coûte 20 cents avec la version 1.0 et 32 avec la version 2.0. Dix mille appels de ce type par mois représentent 40.000 minutes, soit 2.000 dollars contre 3.200, une différence de 1.200 dollars par mois ou 14.400 dollars par an, née d'un changement de routage et non d'une décision de votre part. Pour un opérateur européen, le tarif est libellé en dollars alors que le chiffre d'affaires derrière ces appels est en euros ou en livres, si bien que la hausse tombe sur une ligne de coût déjà exposée à une devise dans laquelle vous ne facturez pas.

Il vaut la peine de vérifier si le gain de vitesse en compense une part, et il n'en approche pas. Supposez que le démarrage plus rapide retire dix secondes entières à cet appel de quatre minutes, bien davantage que ce que l'amélioration de 0,55 seconde sur le délai avant le premier son peut plausiblement offrir. Dix secondes au nouveau tarif valent environ 1,3 cent, contre 12 cents de coût supplémentaire sur le même appel. La version généreuse de l'argument récupère environ un neuvième de la hausse. Acheter le meilleur modèle se défend sur la qualité et sur l'expérience de l'appelant. Ce n'est pas une mesure d'économie, et tout dossier qui le présente ainsi a confondu un modèle plus rapide avec un modèle moins cher.

Épinglez-le ou budgétez-le

Avant mercredi il n'existe que deux positions honnêtes, et toutes deux exigent une action cette semaine. Si votre agent vocal traite un travail routinier et scénarisé pour lequel 75,7 pour cent au comparatif suffisaient déjà, épinglez grok-voice-think-fast-1.0 dans votre configuration et conservez le tarif horaire de 3,00 dollars. Si vos appelants butent régulièrement sur les limites de l'ancien modèle, adoptez la 2.0 délibérément, reprévoyez la ligne vocale à 4,80 dollars l'heure d'audio, et notez au budget que la hausse a acheté de la latence et de la précision, pas des économies. Ce qui ne se défend pas ensuite, c'est de découvrir le changement sur une facture de septembre.

L'habitude plus large à prendre consiste à lire l'unité avant le prix. Demandez-vous, pour chaque service d'IA de votre pile, ce que compte le compteur, car ce seul fait prédit si l'efficacité du fournisseur vous atteindra un jour: les factures au jeton et à la requête baissent à mesure que les modèles progressent, celles à la minute, au siège et à la conversation non. Repérez ensuite les alias. Tout identifiant se terminant par latest est une instruction permanente d'accepter ce que le fournisseur livrera ensuite, prix compris, et les seules charges pour lesquelles ce réglage est le bon sont celles où vous avez décidé d'avance que le coût de la prochaine version vous est indifférent.