Google lanza Gemini 3.8 Flash TTS y Flash-Lite TTS con diseño de voces por texto, replicación desde una muestra, dirección línea a línea y soporte para más de cien idiomas.
Google ha presentado Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos modelos de generación de voz orientados a creadores, desarrolladores y productos empresariales.
Gemini 3.8 Flash TTS permite diseñar una voz desde cero describiendo el papel, el acento y sus características. El sistema funciona en más de cien idiomas y dialectos y ofrece además una biblioteca de más de dos mil voces listas para producción.
La función de replicación puede reconstruir una voz consistente a partir de una muestra de treinta segundos. Google exige una grabación de consentimiento de la persona propietaria de la voz antes de crear el perfil.
Los dos modelos aceptan indicaciones línea a línea para controlar ritmo, emoción, pausas y sonidos conversacionales como risas o suspiros. También pueden mantener dos interlocutores diferenciados en una misma escena.
El sistema está preparado para audio largo, como podcasts y audiolibros, con el objetivo de conservar el timbre y el ritmo durante horas. Las voces pueden guardarse para reutilizarlas con menos variaciones entre proyectos.
Las funciones ya pueden probarse en Google AI Studio y también llegan a Gemini API, Gemini Enterprise, Gemini Notebook y Google Vids. El audio generado incorpora SynthID y credenciales C2PA.