Actualidad IA generativa

Gemini 3.5 Transcribe limpia, corrige y formatea voz en más de 85 idiomas

Google
26 agosto 2026

Qué han lanzado

Gemini 3.5 Transcribe convierte audio en texto limpio y con formato en más de 85 idiomas.

Está disponible para audio en directo y grabaciones mediante las APIs de Gemini.

Qué cambia

El modelo corrige términos, elimina muletillas y aplica puntuación y estructura automáticamente.

Puede distinguir hablantes y añadir marcas de tiempo a la transcripción.

Google presenta Gemini 3.5 Transcribe, un modelo que convierte audio en texto estructurado, elimina muletillas y reconoce más de 85 idiomas.

Google ha presentado Gemini 3.5 Transcribe, un modelo especializado en transformar audio en texto listo para utilizar. No se limita a copiar literalmente lo que escucha: corrige errores, organiza el contenido y aplica formato para reducir la edición posterior.

El modelo admite más de 85 idiomas y puede trabajar con conversaciones, entrevistas, reuniones y grabaciones. También acepta vocabulario personalizado, una opción útil cuando el audio contiene nombres propios, términos técnicos o expresiones específicas de una actividad.

Gemini 3.5 Transcribe elimina muletillas cuando corresponde, añade puntuación y estructura el resultado. Puede producir párrafos más legibles y conservar los detalles importantes sin obligar al usuario a limpiar manualmente una transcripción en bruto.

La identificación de hablantes permite separar hasta tres voces y asociar cada intervención con marcas de tiempo. Google indica que el reconocimiento de más de tres participantes está disponible de forma experimental.

Para audio en directo, los desarrolladores pueden utilizar el modelo gemini-3.5-transcribe-live mediante Live API. La transmisión ofrece resultados con una latencia inferior a un segundo para subtítulos, asistentes de voz y otros usos en tiempo real.

Las grabaciones se procesan con gemini-3.5-transcribe mediante Interactions API. Esta modalidad prioriza la precisión y el formato final cuando no es necesario recibir el texto mientras la persona está hablando.

Según las mediciones citadas por Google, el modelo alcanza una tasa de error de palabra del 4 % en transmisión y del 2,6 % en audio pregrabado. La empresa también afirma que entrega la transcripción final un 70 % más rápido que Chirp 3.

Gemini 3.5 Transcribe está en vista previa pública en Google AI Studio y Gemini Enterprise Agent Platform. También comienza a llegar a productos de consumo, entre ellos Gemini para macOS en inglés y Rambler para Android en regiones seleccionadas.

Ver más