Alibaba lanza Qwen3.8-Flash, un modelo multimodal de pesos abiertos para código y agentes que admite hasta un millón de tokens de contexto.
Alibaba ha presentado Qwen3.8-Flash, un nuevo modelo multimodal de pesos abiertos diseñado para combinar capacidad, velocidad y un coste reducido. Está orientado especialmente a programación, agentes que utilizan herramientas y tareas de oficina que requieren mantener procesos largos.
El modelo utiliza una arquitectura de mezcla de expertos. Su núcleo tiene 125.000 millones de parámetros y añade 51.000 millones mediante representaciones N-gram, pero solo activa 6.000 millones de parámetros por token. Esto permite ofrecer respuestas con menos consumo de cálculo que un modelo denso de tamaño equivalente.
Qwen3.8-Flash admite de forma nativa una ventana de contexto de 262.000 tokens y puede ampliarse hasta un millón. Esa capacidad facilita trabajar con repositorios de código extensos, documentos largos, conversaciones completas o grandes cantidades de información sin fragmentarlas tanto.
Alibaba destaca su rendimiento en programación con agentes, tareas prolongadas, uso de herramientas y comprensión multimodal. El modelo puede combinar texto e imágenes y mantener el contexto durante procesos que requieren planificar, ejecutar acciones y revisar resultados anteriores.
Los pesos están disponibles para descarga en Hugging Face y ModelScope. También se puede acceder al modelo mediante API en Model Studio y Qwen Cloud, con un precio anunciado de 0,16 dólares por millón de tokens de entrada y 0,47 dólares por millón de tokens de salida.
El modelo también se incorpora a QwenWork, la plataforma de agentes de trabajo de Alibaba. Allí impulsa un modo Standard renovado que, según la compañía, reduce en un 75 % el consumo de tokens por tarea y aproximadamente duplica la velocidad de generación frente al modo anterior.
Para conseguir esta eficiencia, Alibaba combina distintos mecanismos de atención. El sistema utiliza Gated DeltaNet para comprimir el historial y Qwen Sparse Attention para seleccionar las partes relevantes de contextos extensos sin procesarlas todas con el mismo coste.
Qwen3.8-Flash sirve además como adelanto de la arquitectura prevista para la futura familia Qwen4. Alibaba afirma que necesita cerca de una novena parte de los recursos de entrenamiento de Qwen3.7-Plus, pese a ofrecer mejores resultados en sus pruebas de programación y tareas de oficina.