Ce que Microsoft a lancé, et où il se situe
Microsoft a lancé MAI-Transcribe-2 le 3 septembre 2026, et le modèle domine désormais FLEURS, le benchmark standard de reconnaissance vocale multilingue couvrant 60 langues, avec un taux d'erreur moyen sur les mots de 5,2 pour cent. Sur le classement distinct d'Artificial Analysis, il s'est classé deuxième.
Le modèle ajoute la reconnaissance des locuteurs, l'horodatage au mot près, le biais sur mots-clés, des styles de transcription littérale ou épurée configurables, le changement de langue en cours de phrase et l'identification automatique de la langue. Il est disponible via Microsoft Foundry, MAI Playground et Open Router.
Le chiffre qui compte est le prix, pas le score
Microsoft facture 0,10 dollar par heure d'audio traitée, une offre à durée limitée valable jusqu'à fin 2026. Un communiqué de Microsoft l'a qualifié de modèle de transcription le plus performant de l'entreprise à ce jour, mais aussi le plus performant et efficace parmi ses concurrents.
Un classement dans un benchmark, n'importe quel laboratoire peut le contester avec ses propres chiffres le trimestre suivant. Un prix aussi bas, venant d'une entreprise avec la distribution de Microsoft, est plus difficile à faire remonter une fois que les clients ont bâti leurs flux de travail dessus.
La comparaison de vitesse, avec les chiffres de Microsoft
Les chiffres de vitesse publiés par Microsoft, comparés aux trois modèles de transcription qu'il cite directement, donnent ceci :
| Modèle | Fournisseur | Vitesse face à MAI-Transcribe-2 |
|---|---|---|
| MAI-Transcribe-2 | Microsoft | Référence |
| GPT-Transcribe | OpenAI | 10 fois plus lent |
| Scribe v2 | ElevenLabs | 7 fois plus lent |
| Gemini 3.5 Transcribe | 5 fois plus lent |
Ce sont les comparaisons propres de Microsoft, pas un test indépendant d'un tiers, donc une entreprise qui envisage un changement devrait tout de même faire passer son propre échantillon audio par chaque option avant de trancher.
Pourquoi c'est une question de marge, pas seulement de modèle
De nombreux outils européens vendent la transcription vocale comme une fonction incluse dans un produit d'enregistrement d'appels, de notes de réunion ou de support client, à un prix bien supérieur à ce que coûte désormais l'accès brut au modèle. Cet écart était autrefois le prix d'une précision correcte ; il devient de plus en plus simplement la marge du fournisseur.
Une entreprise qui paie des frais mensuels de transcription par utilisateur dispose maintenant d'un calcul simple : multiplier ses heures d'audio mensuelles réelles par 0,10 dollar et comparer le résultat à ce qui lui est facturé. Un écart important mérite une conversation avec le fournisseur, pas l'hypothèse que le tarif reflète encore le coût sous-jacent.
Le piège : un prix promotionnel, pas un plancher
L'annonce de Microsoft elle-même présente les 0,10 dollar par heure d'audio comme disponibles jusqu'à fin 2026, pas comme un tarif catalogue permanent. Les guerres de prix dans l'infrastructure de l'IA se sont déjà retournées aussi vite, et les fournisseurs qui ont baissé les prix pour gagner des parts les ont relevés une fois la part conquise.
Tout contrat ou budget interne bâti ce trimestre sur ce prix devrait supposer qu'il ne tiendra peut-être pas l'année prochaine, et devrait inclure une clause de révision ou de sortie plutôt que de traiter le tarif promotionnel comme la base d'un plan pluriannuel.
À lire ensuite: Microsoft parie 2,5 milliards : l'outil ne suffit pas | Microsoft Plafonne Désormais Ce Que Dépensent Ses Ingénieurs En IA



