Actualidad IA generativa

Qwen3.8-Flash llega con un millón de tokens de contexto y un coste mínimo

Qwen
27 agosto 2026

Qué han lanzado

Qwen3.8-Flash es un modelo multimodal de pesos abiertos para código, agentes y tareas con herramientas.

Admite 262.000 tokens de forma nativa y puede ampliar el contexto hasta un millón.

Qué cambia

Activa solo 6.000 millones de parámetros por token para reducir el coste y acelerar las respuestas.

En QwenWork consume un 75 % menos de tokens por tarea y genera aproximadamente el doble de rápido.

Alibaba lanza Qwen3.8-Flash, un modelo multimodal de pesos abiertos para código y agentes que admite hasta un millón de tokens de contexto.

Alibaba ha presentado Qwen3.8-Flash, un nuevo modelo multimodal de pesos abiertos diseñado para combinar capacidad, velocidad y un coste reducido. Está orientado especialmente a programación, agentes que utilizan herramientas y tareas de oficina que requieren mantener procesos largos.

El modelo utiliza una arquitectura de mezcla de expertos. Su núcleo tiene 125.000 millones de parámetros y añade 51.000 millones mediante representaciones N-gram, pero solo activa 6.000 millones de parámetros por token. Esto permite ofrecer respuestas con menos consumo de cálculo que un modelo denso de tamaño equivalente.

Qwen3.8-Flash admite de forma nativa una ventana de contexto de 262.000 tokens y puede ampliarse hasta un millón. Esa capacidad facilita trabajar con repositorios de código extensos, documentos largos, conversaciones completas o grandes cantidades de información sin fragmentarlas tanto.

Alibaba destaca su rendimiento en programación con agentes, tareas prolongadas, uso de herramientas y comprensión multimodal. El modelo puede combinar texto e imágenes y mantener el contexto durante procesos que requieren planificar, ejecutar acciones y revisar resultados anteriores.

Los pesos están disponibles para descarga en Hugging Face y ModelScope. También se puede acceder al modelo mediante API en Model Studio y Qwen Cloud, con un precio anunciado de 0,16 dólares por millón de tokens de entrada y 0,47 dólares por millón de tokens de salida.

El modelo también se incorpora a QwenWork, la plataforma de agentes de trabajo de Alibaba. Allí impulsa un modo Standard renovado que, según la compañía, reduce en un 75 % el consumo de tokens por tarea y aproximadamente duplica la velocidad de generación frente al modo anterior.

Para conseguir esta eficiencia, Alibaba combina distintos mecanismos de atención. El sistema utiliza Gated DeltaNet para comprimir el historial y Qwen Sparse Attention para seleccionar las partes relevantes de contextos extensos sin procesarlas todas con el mismo coste.

Qwen3.8-Flash sirve además como adelanto de la arquitectura prevista para la futura familia Qwen4. Alibaba afirma que necesita cerca de una novena parte de los recursos de entrenamiento de Qwen3.7-Plus, pese a ofrecer mejores resultados en sus pruebas de programación y tareas de oficina.

Ver más