Actualidad IA generativa

Black Forest Labs presenta FLUX 3 en acceso anticipado

Black Forest Labs
23 julio 2026

Qué han lanzado

FLUX 3, un modelo multimodal en acceso anticipado.

Entrenamiento conjunto con imágenes, vídeos y audio.

Qué cambia

La familia FLUX pasa de generación de imagen a una arquitectura más amplia para vídeo, audio y comprensión visual.

Black Forest Labs presenta FLUX 3, un modelo multimodal en acceso anticipado que aprende de imágenes, vídeos y audio dentro de una arquitectura unificada.

Black Forest Labs ha presentado FLUX 3, su nuevo modelo fundacional multimodal en acceso anticipado. La compañía lo define como una arquitectura que aprende de imágenes, vídeos y audio de forma conjunta, con el objetivo de construir una representación más completa del mundo visual.

La diferencia principal frente a generaciones anteriores de FLUX está en la multimodalidad. Mientras FLUX 1 y FLUX 2 se centraban en imagen, FLUX 3 incorpora vídeo y audio para capturar movimiento, relaciones temporales y señales sonoras dentro de un mismo marco de entrenamiento.

Black Forest Labs explica que una imagen ofrece estructura espacial, el vídeo añade dinámica temporal y el audio aporta relaciones causales que la visión por sí sola puede perder. Con FLUX 3, la compañía busca que el modelo entienda mejor cómo se comportan los objetos, cómo se mueven y cómo se relacionan los eventos.

El anuncio también conecta FLUX 3 con FLUX-mimic, una línea de trabajo aplicada a modelos de video-acción para robótica. Esa parte se desarrolla junto a mimic robotics y se presenta como una extensión del mismo enfoque multimodal hacia sistemas que interpretan y actúan en el mundo físico.

FLUX 3 está disponible en acceso anticipado desde el 23 de julio de 2026. Black Forest Labs indica que distintas capacidades se desplegarán por fases, con acceso inicial limitado y versiones específicas previstas para más adelante.

Ver más