Z.ai lanza GLM-5.3-Flash, un modelo multimodal abierto para código y agentes con visión, 320.000 millones de parámetros y contexto de un millón de tokens.
Z.ai ha lanzado GLM-5.3-Flash, el primer modelo de la serie GLM-5 diseñado de forma nativa para combinar texto e imagen. Está orientado a programación, agentes y tareas que requieren comprender tanto instrucciones escritas como contenido visual.
El modelo utiliza una arquitectura de mezcla de expertos con 320.000 millones de parámetros totales y 18.000 millones activos en cada ejecución. Este diseño busca ofrecer capacidad elevada sin utilizar todos los parámetros para cada respuesta.
GLM-5.3-Flash admite un contexto de hasta un millón de tokens. La ventana permite trabajar con repositorios extensos, documentos largos o conjuntos amplios de archivos sin dividir la información en tantas sesiones independientes.
Las capacidades visuales se aplican al desarrollo de software. El modelo puede interpretar capturas, interfaces, documentos, hojas de cálculo, presentaciones y paneles, y utilizar esa información para crear código o comprobar el resultado de lo que ha generado.
Z.ai también destaca su uso en tareas de agentes, donde el modelo debe planificar, utilizar herramientas y revisar pasos anteriores. La combinación de visión y código permite que el agente observe una interfaz y decida cómo continuar sin depender únicamente de descripciones textuales.
La empresa afirma que GLM-5.3-Flash supera a GLM-5.2 en sus evaluaciones internas y se acerca a modelos de mayor tamaño en programación y trabajo con agentes. Estas comparaciones proceden de las pruebas publicadas por Z.ai.
El modelo se incorpora a GLM Coding Plan con una cuota de uso tres veces mayor que la asignada a GLM-5.3. También puede utilizarse mediante las herramientas de Z.ai para programación y control del navegador.
Los pesos se han publicado para descarga y ejecución local. Los entornos SGLang, vLLM y TokenSpeed ofrecen soporte para desplegar el modelo en infraestructura propia.