Actualidad IA generativa

Meta lanza un modelo que transcribe en directo y separa a más de 20 hablantes

Meta
1 septiembre 2026

Qué han lanzado

Muse Voice Transcribe para convertir audio en texto en tiempo real.

Separación de más de 20 hablantes y soporte multilingüe.

Qué cambia

Las aplicaciones pueden recibir transcripción mientras la conversación continúa.

El modelo trabaja con audios largos y cambios de idioma dentro de una sesión.

Muse Voice Transcribe convierte audio en texto en tiempo real, distingue a más de 20 personas y admite conversaciones multilingües largas.

Meta ha presentado Muse Voice Transcribe, un modelo de percepción de audio diseñado para transcribir en tiempo real. Está preparado para trabajar mientras el audio sigue llegando, en lugar de esperar a que termine una grabación completa antes de producir el texto.

El modelo combina reconocimiento de voz, detección del final de cada intervención y separación de hablantes. Puede distinguir a más de 20 personas dentro de una conversación, lo que facilita convertir reuniones, entrevistas, clases y debates en transcripciones organizadas por participante.

Muse Voice Transcribe se ha entrenado con más de 70 idiomas y Meta ha verificado de forma exhaustiva 25 en esta primera versión, entre ellos el español. También admite cambios de idioma dentro de una misma conversación y audios de más de una hora.

El procesamiento en streaming reduce la espera entre la voz y el texto. La detección del final de turno permite entregar fragmentos completos con rapidez, una característica útil para subtítulos en directo, asistentes de voz y aplicaciones que necesitan reaccionar durante la conversación.

Meta ofrece el modelo mediante Meta Model API, Meta AI para Mac y Muse Code. La compañía lo presenta como una base para productos que necesitan comprender audio continuo, identificar quién habla y conservar el contexto en sesiones extensas.

Ver más