Qué lanzó Microsoft, y en qué posición quedó
Microsoft lanzó MAI-Transcribe-2 el 3 de septiembre de 2026, y el modelo lidera ahora FLEURS, el benchmark estándar de reconocimiento de voz multilingüe en 60 idiomas, con una tasa media de error de palabras del 5,2 por ciento. En la clasificación independiente de Artificial Analysis quedó segundo.
El modelo incorpora identificación de hablantes, marcas de tiempo por palabra, sesgo de palabras clave, estilos de transcripción literal o depurada configurables, cambio de idioma a mitad de frase e identificación automática del idioma. Está disponible en Microsoft Foundry, MAI Playground y Open Router.
El número que importa es el precio, no la puntuación
Microsoft cobra 0,10 dólares por hora de audio procesada, una oferta por tiempo limitado vigente hasta finales de 2026. Un comunicado de Microsoft lo calificó como no solo su modelo de transcripción más capaz hasta la fecha, sino el más capaz y eficiente entre sus competidores.
Cualquier laboratorio puede rebatir una posición en un benchmark con sus propias cifras el trimestre siguiente. Un precio tan bajo, de una empresa con la distribución de Microsoft, es más difícil de revertir una vez que los clientes han construido sus flujos de trabajo sobre él.
La comparación de velocidad, con las cifras de Microsoft
Las cifras de velocidad publicadas por Microsoft, comparadas con los tres modelos de transcripción que menciona directamente, son estas:
| Modelo | Proveedor | Velocidad frente a MAI-Transcribe-2 |
|---|---|---|
| MAI-Transcribe-2 | Microsoft | Referencia |
| GPT-Transcribe | OpenAI | 10 veces más lento |
| Scribe v2 | ElevenLabs | 7 veces más lento |
| Gemini 3.5 Transcribe | 5 veces más lento |
Se trata de comparaciones propias de Microsoft, no de una prueba independiente de un tercero, así que una empresa que valore un cambio debería probar su propio audio con cada opción antes de decidirse.
Por qué esto es una cuestión de margen, no solo de modelo
Muchas herramientas europeas venden la conversión de voz a texto como una función incluida dentro de un producto de grabación de llamadas, notas de reuniones o atención al cliente, con un precio muy superior al que cuesta hoy el acceso al modelo puro. Esa diferencia solía ser el coste de una precisión decente; cada vez más, es simplemente el margen del proveedor.
Una empresa que paga una cuota mensual de transcripción por usuario tiene ahora una cuenta sencilla que hacer: multiplicar sus horas de audio mensuales reales por 0,10 dólares y comparar el resultado con lo que se le factura. Una diferencia grande merece una conversación con el proveedor, no la suposición de que la tarifa sigue reflejando el coste real.
La trampa: un precio promocional, no un suelo
El propio anuncio de Microsoft enmarca los 0,10 dólares por hora de audio como disponibles hasta finales de 2026, no como un precio de lista permanente. Las guerras de precios en infraestructura de IA se han revertido antes con esta misma rapidez, y los proveedores que bajaron precios para ganar cuota los han vuelto a subir una vez conseguida.
Cualquier contrato o presupuesto interno construido este trimestre sobre este precio debería asumir que podría no mantenerse el año que viene, e incluir una cláusula de revisión de precio o de salida en lugar de tratar la tarifa promocional como base de un plan plurianual.
Leer a continuación: Microsoft: 2500 millones, y las herramientas no bastan | Microsoft Ya Limita Lo Que Gastan Sus Propios Ingenieros En IA



