DeepSeek abre DeepSeek-V4-Flash-Vision-Exp, un modelo experimental que combina texto e imágenes y puede describir fotografías, leer capturas y analizar gráficos.
DeepSeek ha incorporado capacidades visuales a su plataforma con DeepSeek-V4-Flash-Vision-Exp. El modelo experimental recibe texto e imágenes dentro de una misma consulta, por lo que puede interpretar contenido visual y responder sobre él sin recurrir a una herramienta separada.
Entre los usos descritos por la compañía están la descripción de fotografías, la lectura de capturas de pantalla y el análisis de gráficos. Esto permite enviar una interfaz, un documento visual o una gráfica y formular preguntas concretas sobre lo que aparece en la imagen.
El modelo admite archivos JPEG, PNG, GIF y WebP. Las imágenes pueden enviarse como datos codificados en base64, mediante una URL accesible o a través de la Files API, que permite subirlas una vez y reutilizarlas posteriormente con su identificador.
DeepSeek mantiene compatibilidad con las interfaces habituales de desarrollo. El modelo puede utilizarse mediante Chat Completions y Responses con formato compatible con OpenAI, además de una interfaz de mensajes compatible con Anthropic.
Cada petición puede incluir hasta 600 imágenes. Antes de procesarlas, el sistema adapta su tamaño y limita el consumo visual a un máximo de 384 tokens por imagen, una medida que facilita controlar el coste cuando se analizan lotes grandes.
La denominación experimental indica que esta versión sirve para probar las nuevas capacidades visuales antes de una incorporación definitiva a la familia principal. El acceso ya está documentado en la API de DeepSeek.