xAI lanza Grok Voice Transcribe 2.0, un modelo de voz a texto más preciso para llamadas, conversaciones y audio multilingüe que mantiene las tarifas de la versión anterior.
xAI ha lanzado Grok Voice Transcribe 2.0, la nueva versión de su modelo para convertir voz en texto. La actualización está pensada para audio real, como llamadas telefónicas, conversaciones con varias personas, grabaciones con ruido y mensajes en los que se dictan nombres, direcciones, números o correos electrónicos.
El modelo se apoya en la misma base de audio utilizada por Grok Voice y mejora la precisión sin aumentar las tarifas. Según las evaluaciones presentadas por xAI, comete aproximadamente la mitad de errores que Grok Voice Transcribe 1.0 y ocupa la primera posición en precisión entre 32 modelos de transcripción en streaming evaluados por Artificial Analysis.
La mejora más amplia aparece en el audio multilingüe. Grok Voice Transcribe 2.0 reconoce decenas de idiomas, detecta automáticamente cuál se está hablando y puede seguir cambios de idioma dentro de una misma grabación. En la prueba de frases cortas realizada por xAI con 19 idiomas, la tasa de error por palabra bajó del 20,6 % al 6,8 %.
Puede utilizarse tanto con archivos y direcciones de audio como con transmisiones en tiempo real. También devuelve marcas de tiempo y niveles de confianza para cada palabra, separa a los distintos hablantes y permite transcribir hasta ocho canales de audio de forma independiente.
Los desarrolladores pueden proporcionar hasta 100 términos específicos para ayudar al modelo a reconocer nombres de productos, vocabulario médico u otras palabras propias de una actividad. También puede dar formato a fechas, monedas, teléfonos y direcciones de correo, eliminar muletillas y detectar cuándo una persona ha terminado su turno al hablar.
El modelo ya está disponible en la API de voz a texto de xAI con el identificador `grok-voice-transcribe-2.0`. Las integraciones existentes pueden recibir la mejora sin modificar su estructura, y xAI prevé convertir esta versión en la opción predeterminada y retirar la versión 1.0 durante las próximas semanas.
El precio continúa en 0,10 dólares por cada hora de audio procesada por lotes y 0,20 dólares por hora en transcripción en streaming. La separación de hablantes, las marcas de tiempo y los términos personalizados están incluidos sin coste adicional.
Atlassian ya utiliza Grok Voice Transcribe 2.0 para transcribir todos los vídeos de Loom. Esas transcripciones pueden reutilizarse después en otros flujos, como convertir una explicación grabada en instrucciones de trabajo o enviarla a una herramienta de programación para aplicar cambios sobre un proyecto.