Qwen presenta Qwen-Image-3.0, un modelo de generación de imagen centrado en composiciones complejas, texto legible, detalles realistas y conocimiento visual más amplio.
Qwen ha lanzado Qwen-Image-3.0, la tercera generación de su familia de modelos fundacionales para generación de imágenes. El anuncio se centra en una idea principal: pasar de imágenes visualmente atractivas a imágenes más útiles para tareas con contenido complejo y detalles verificables.
La compañía resume la mejora en tres ejes: contenido rico, detalles auténticos y conocimiento profundo. En la práctica, Qwen-Image-3.0 admite instrucciones de hasta 4.500 tokens, lo que le permite construir composiciones densas como periódicos, storyboards, interfaces o materiales educativos con muchos elementos dentro de una sola imagen.
Uno de los puntos destacados es la representación de texto pequeño. Qwen afirma que el modelo puede renderizar texto de hasta 10 píxeles con mejor legibilidad, además de reproducir fórmulas, anotaciones, documentos, interfaces y estructuras visuales con mayor precisión.
El modelo también se orienta a imágenes con más detalle físico, como piel, pelo, objetos, papel o restauración de contenido visual dañado. En los ejemplos oficiales se muestran retratos, documentos, infografías, interfaces y tareas de edición donde el modelo mantiene mejor la coherencia visual.
Otro cambio relevante es el soporte nativo para 12 idiomas y la capacidad de generar interfaces conocidas, escenas con conocimiento del mundo y recursos visuales más útiles para productividad, educación, diseño, contenido y comercio electrónico.
Qwen-Image-3.0 apunta a un problema muy concreto de los modelos de imagen: no solo crear una imagen visualmente atractiva, sino generar materiales con texto, estructura y detalle suficientes para usos de diseño, documentación, educación o contenido.