GPT-Live-1 permite crear asistentes de voz con conversaciones simultáneas, interrupciones naturales, llamadas telefónicas y delegación de tareas a GPT-6 Astra u otros modelos.
OpenAI ha lanzado GPT-Live-1 en su API para que desarrolladores y empresas puedan crear aplicaciones y agentes de voz con conversaciones más naturales. El modelo puede escuchar y hablar al mismo tiempo, una capacidad conocida como comunicación full-duplex.
Esta arquitectura permite que una persona interrumpa, dude, cambie de idea o añada información mientras el asistente está respondiendo. Al procesar conjuntamente el audio entrante y saliente, evita parte de la latencia y los fallos que aparecen al encadenar transcripción, modelo de texto y síntesis de voz por separado.
GPT-Live-1 puede delegar razonamientos complejos y llamadas a herramientas en un modelo de texto conectado, como GPT-6 Astra, o en modelos de terceros. Así, la capa de voz mantiene la conversación mientras otro sistema busca información o ejecuta una acción.
Los desarrolladores pueden ajustar mediante instrucciones el tono, el ritmo y el estilo de conversación. El modelo también mejora el manejo del silencio y el ruido de fondo, conserva mejor el contexto en sesiones largas y puede utilizarse para agentes telefónicos.
La API amplía el catálogo de voces con más acentos, dialectos e idiomas. OpenAI ofrece GPT-Live-1 por 0,05 dólares por minuto para la capa de voz; el modelo de razonamiento y las herramientas conectadas se facturan aparte según su uso.