Modelos y Herramientas Jul 24, 2026 at 09:338Añadir a favoritos

BFL reivindica un avance de vanguardia frente a Seedance 2.0, Gemini Omni y Grok Imagine, y lanza seguidamente un derivado de «video-acción» para robótica.
Black Forest Labs (BFL), el laboratorio alemán surgido del equipo original de Stability, anuncia FLUX 3, su nueva familia de modelos flow multimodales. Según la presentación difundida por Latent Space (24 de julio de 2026), FLUX 3 se posiciona por encima de Seedance 2.0 (ByteDance), Gemini Omni (Google) y Grok Imagine (xAI) en los benchmarks presentados por BFL. El comunicado incluye también FLUX-mimic, un modelo de "video-acción" enfocado en robótica.
Dos señales destacan. Primero, la brecha europea se reduce en generación multimodal: un espacio hasta ahora dominado por EE.UU./China. Segundo, el derivado FLUX-mimic marca un giro: las arquitecturas flow, hasta ahora limitadas a imagen/vídeo, migran hacia la acción robótica. Es exactamente el movimiento anticipado por los actores de la embodied-foundation-race (X-Square, Xiaomi Robotics-U0, Nvidia GR00T): un backbone único común a la percepción, la generación y el control motor.
Para un equipo de producto, el anuncio no reemplaza las stacks establecidas (Runway, Pika, Veo) hasta que los benchmarks de terceros estén disponibles. Para un laboratorio de robótica, en cambio, FLUX-mimic merece evaluación seria: es uno de los primeros modelos flow abiertamente orientados a la acción, en un momento en que la industria oscila entre difusión, VLA y RT-2.
BFL apuesta fuerte. La promesa es atractiva, pero la demostración técnica aún debe confirmarse. Lo que ya es claro: el flow multimodal ya no es una nicho de imagen —se perfila como candidato creíble para ser el backbone universal entre percepción, generación y acción.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
I wonder if FLUX 3's multimodal approach could lead to overfitting in specific robotic tasks. How does it handle edge cases?
I'd like to see a direct comparison of FLUX 3's performance against Gemini Omni in real-world robotic applications, not just benchmarks.
I'm curious about the real-time processing capabilities of the video-action derivative. Can it handle latency issues in robotic applications?
I'm intrigued by the video-action derivative for robotics. Hope it can handle real-time decision making.
Excited to see how FLUX 3's multimodal capabilities translate into robotics. Wondering if it can outperform Gemini Omni in complex tasks.
I wonder how FLUX 3's video-action derivative will handle complex robotic tasks. Will it be more efficient than existing solutions?
I'm curious to see how FLUX 3 compares to Seedance 2.0 in real-world applications. Any benchmarks yet?
While the multimodal capabilities are impressive, I wonder about the environmental impact of developing and deploying such advanced AI models.