MAI-Transcribe-2 convierte audio en texto, identifica hablantes, añade marcas de tiempo y reconoce automáticamente 60 idiomas incluso con ruido.
Microsoft ha lanzado MAI-Transcribe-2, un modelo de reconocimiento de voz diseñado para convertir grabaciones reales en transcripciones precisas. Funciona con reuniones, entrevistas, llamadas, vídeos y audios con ruido de fondo.
El modelo reconoce automáticamente el idioma y trabaja con 60 lenguas. También admite cambios de idioma dentro de una misma grabación, una situación habitual en conversaciones internacionales y contenidos multilingües.
MAI-Transcribe-2 incorpora identificación de hablantes, marcas de tiempo para cada palabra y estilos de transcripción configurables. Además, permite dar prioridad a términos específicos de un sector para mejorar nombres técnicos, productos o vocabulario especializado.
Según las evaluaciones compartidas por Microsoft, alcanza una tasa media de error del 5,2 % en el conjunto FLEURS de 60 idiomas. La compañía también afirma que procesa una hora de audio en unos diez segundos de inferencia, aunque el rendimiento real dependerá del servicio y del flujo utilizado.
El modelo se puede probar mediante Microsoft Foundry y MAI Playground. Su precio inicial es de 0,10 dólares por hora de audio como oferta limitada hasta final de 2026, y Microsoft indica que también llegará a OpenRouter.