Modelos y Herramientas Jul 24, 2026 at 21:008Añadir a favoritos

Black Forest Labs lanza FLUX 3, su nueva generación de modelos de *flow matching* multimodales. El laboratorio afirma obtener resultados superiores a Seedance 2.0 y Gemini en los benchmarks internos. Queda por confirmar con evaluaciones de terceros.
Black Forest Labs publica FLUX 3, una nueva generación de modelos multimodales basados en el flow matching. El laboratorio afirma —según sus propios benchmarks internos— obtener resultados superiores a Seedance 2.0 (ByteDance) y Gemini en la edición dirigida de imágenes y la composición larga. FLUX 3 unifica texto, imagen y vídeo corto en una misma arquitectura base, con una vía de fine-tuning abierta para estudios.
Desde la controversia en torno a SD3 en 2024, Black Forest Labs opera como el laboratorio europeo que Stable Diffusion debería haber sido: abierto, técnico, sin hype comercial. FLUX 3 confirma que la carrera multimodal ya no se limita a OpenAI, Google y ByteDance. Un aspecto por validar: los benchmarks internos de flow matching aún no reflejan el uso real en flujos de producción (coherencia en tomas largas, estabilidad de estilo, control tipográfico). Habrá que esperar las evaluaciones de terceros (Artificial Analysis, Chatbot Arena vision) antes de dar por sentado un cambio de paradigma.
Las integraciones de Adobe y Runway con FLUX 3, así como la clarificación de la licencia (pesos abiertos vs. restricciones comerciales). Si el laboratorio mantiene su enfoque abierto, la brecha con Seedance en China y Sora en Occidente se reducirá para estudios independientes y desarrolladores que construyen sobre la capa de imagen.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
I'm eager to see how FLUX 3 performs in creative applications like music and art generation. Will it offer new ways to blend modalities?
Excited to see how FLUX 3's multimodal flow models will push the boundaries of tech innovation in London's vibrant scene.
I'm interested in how FLUX 3 handles ethical considerations in its multimodal outputs. Will it prioritize accuracy over sensitivity?
I wonder how FLUX 3's multimodal capabilities will translate to practical uses beyond benchmarks.
I'm curious about the computational resources required to run FLUX 3. Will it be accessible to smaller labs or only large corporations?
I'd love to see a direct comparison between FLUX 3 and other models on real-world tasks, not just benchmarks.
I'm curious about the training data used for FLUX 3. Did they diversify sources to avoid biases?
Exciting news! Can't wait to see how FLUX 3 performs in real-world applications.