Google lanza Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking para agentes de voz capaces de comprender imágenes, cambiar entre 97 idiomas y ejecutar herramientas en segundo plano mientras mantienen una conversación natural.
Google ha lanzado Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de diálogo en tiempo real diseñados para conversar por voz y completar tareas mientras la interacción continúa.
Gemini 3.8 Live está orientado a ofrecer conversaciones fluidas con un coste adecuado para aplicaciones a gran escala. Puede utilizar contexto visual casi en tiempo real, responder sobre lo que ve y cambiar automáticamente entre 97 idiomas dentro de una misma conversación.
El modelo puede llamar a herramientas y API en segundo plano sin dejar al usuario esperando en silencio. De este modo, reconoce la petición, mantiene la conversación y comunica el resultado cuando termina la acción solicitada.
Gemini 3.8 Live Extended Thinking está pensado para trabajos que necesitan más razonamiento y varios pasos. Puede razonar y hablar a la vez, ofrecer indicaciones de progreso y coordinar llamadas asíncronas mientras conserva el hilo de la conversación.
Google muestra usos como convertir bocetos y comentarios hablados en componentes de React, coordinar reservas que requieren varias acciones, resolver problemas mediante contexto visual y crear planes de negocio o materiales de marketing a partir de instrucciones por voz.
En sus resultados publicados, la versión Extended Thinking alcanza el primer puesto del índice Speech to Speech Quality de Artificial Analysis con 82,6 puntos. También obtiene un 68,6 % en el benchmark de tareas de voz τ-Voice y un 97,7 % en Big Bench Audio.
Los dos modelos empiezan a estar disponibles para desarrolladores mediante Gemini API y Google AI Studio. Gemini 3.8 Live llega también a Search Live, mientras que Extended Thinking se despliega en Gemini Live y en funciones de voz de Docs, Gmail y Keep según el plan contratado.
Las empresas pueden probarlos en vista previa privada dentro de Gemini Enterprise. Todo el audio generado por los productos de Google con estos modelos incorpora una marca imperceptible SynthID para facilitar su identificación como contenido creado con IA.