xAI presenta Grok Voice Think Fast 2.0, un modelo speech-to-speech con mejoras en conversación, transcripción, razonamiento y velocidad de respuesta.
xAI ha presentado Grok Voice Think Fast 2.0, su nueva generación de modelo de voz speech-to-speech. La compañía lo define como su modelo de voz más capaz hasta ahora, con avances en inteligencia conversacional, transcripción y capacidad para trabajar con herramientas.
El modelo está orientado a conversaciones de voz en tiempo real. Según xAI, mejora la naturalidad del diálogo, formula respuestas más breves y reduce la fricción en conversaciones donde el agente debe pensar varios pasos mientras sigue hablando.
En las métricas publicadas por la compañía, Grok Voice Think Fast 2.0 alcanza un índice general de calidad speech-to-speech del 82,9% en Artificial Analysis. También reduce el tiempo hasta el primer audio frente a la versión anterior y mejora la precisión de transcripción en 24 idiomas.
xAI explica que el modelo razona mientras habla, una característica pensada para acelerar llamadas a herramientas y mantener conversaciones más fluidas. La compañía también señala mejoras en entornos con ruido y compresión telefónica.
El modelo tendrá un precio de 0,08 dólares por minuto de audio. El 5 de agosto de 2026 pasará a ser el modelo predeterminado bajo grok-voice-latest, aunque quienes necesiten quedarse en la versión anterior podrán fijar grok-voice-think-fast-1.0 antes del cambio.
La actualización coloca a Grok dentro de la competencia por modelos de voz para asistentes, agentes telefónicos y experiencias conversacionales donde no basta con convertir voz a texto, sino que el modelo debe responder directamente en audio.