Actualidad IA generativa

OpenAI lleva GPT-Live-1 a la API para crear agentes de voz que escuchan y hablan a la vez

OpenAI
10 septiembre 2026

Qué han lanzado

OpenAI ha lanzado GPT-Live-1 en la API para crear agentes de voz full-duplex capaces de escuchar y hablar simultáneamente.

Qué cambia

Los asistentes pueden gestionar interrupciones, ruido y sesiones largas, además de delegar razonamiento y acciones a otros modelos y herramientas.

GPT-Live-1 permite crear asistentes de voz con conversaciones simultáneas, interrupciones naturales, llamadas telefónicas y delegación de tareas a GPT-6 Astra u otros modelos.

OpenAI ha lanzado GPT-Live-1 en su API para que desarrolladores y empresas puedan crear aplicaciones y agentes de voz con conversaciones más naturales. El modelo puede escuchar y hablar al mismo tiempo, una capacidad conocida como comunicación full-duplex.

Esta arquitectura permite que una persona interrumpa, dude, cambie de idea o añada información mientras el asistente está respondiendo. Al procesar conjuntamente el audio entrante y saliente, evita parte de la latencia y los fallos que aparecen al encadenar transcripción, modelo de texto y síntesis de voz por separado.

GPT-Live-1 puede delegar razonamientos complejos y llamadas a herramientas en un modelo de texto conectado, como GPT-6 Astra, o en modelos de terceros. Así, la capa de voz mantiene la conversación mientras otro sistema busca información o ejecuta una acción.

Los desarrolladores pueden ajustar mediante instrucciones el tono, el ritmo y el estilo de conversación. El modelo también mejora el manejo del silencio y el ruido de fondo, conserva mejor el contexto en sesiones largas y puede utilizarse para agentes telefónicos.

La API amplía el catálogo de voces con más acentos, dialectos e idiomas. OpenAI ofrece GPT-Live-1 por 0,05 dólares por minuto para la capa de voz; el modelo de razonamiento y las herramientas conectadas se facturan aparte según su uso.

Ver más