xAI amplía Grok Imagine Video 1.5 con generación de vídeo desde texto, referencias de imagen y voz, y salida nativa en 1080p.
xAI ha presentado una actualización de Grok Imagine Video 1.5 centrada en dar más control a la generación de vídeo. La novedad añade referencias de imagen y voz, generación de vídeo desde texto y soporte nativo para 1080p.
La función permite describir una escena sin aportar una imagen inicial. Según xAI, el sistema combina generación de imagen con generación de vídeo para crear clips a partir de una indicación de texto.
Las referencias de imagen sirven para fijar elementos concretos dentro de una generación, como una cara, un producto o una localización. El modelo puede usar hasta siete imágenes de referencia en una misma generación para mantener esos elementos más estables.
La referencia de voz está pensada para conservar una voz concreta junto al personaje. xAI indica que las referencias de imagen y voz empiezan en Estados Unidos para usuarios de SuperGrok Heavy y SuperGrok Plus, con despliegue al resto de niveles durante los días siguientes.
La actualización también llega a la API de xAI mediante el modelo `grok-imagine-video-1.5`. En la API ya están disponibles las referencias de imagen, la generación de vídeo desde texto y el 1080p nativo; el soporte de voz se ofrece bajo solicitud.