Black Forest Labs lanza FLUX 3: un modelo flow multimodal que se extiende a la robótica

Modelos y Herramientas Jul 24, 2026 at 09:338Añadir a favoritos

Black Forest Labs lanza FLUX 3: un modelo flow multimodal que se extiende a la robótica
Ilustración : Léa Fontaine

BFL reivindica un avance de vanguardia frente a Seedance 2.0, Gemini Omni y Grok Imagine, y lanza seguidamente un derivado de «video-acción» para robótica.

Contexto

Black Forest Labs (BFL), el laboratorio alemán surgido del equipo original de Stability, anuncia FLUX 3, su nueva familia de modelos flow multimodales. Según la presentación difundida por Latent Space (24 de julio de 2026), FLUX 3 se posiciona por encima de Seedance 2.0 (ByteDance), Gemini Omni (Google) y Grok Imagine (xAI) en los benchmarks presentados por BFL. El comunicado incluye también FLUX-mimic, un modelo de "video-acción" enfocado en robótica.

Los datos

  • Familia anunciada: FLUX 3 (flow multimodal).
  • Competidores citados por BFL: Seedance 2.0, Gemini Omni, Grok Imagine.
  • Derivado: FLUX-mimic - modelo de video-acción para robótica.
  • Fuente: Latent Space, 24 de julio de 2026 (benchmarks por validar por un tercero).

Análisis

Dos señales destacan. Primero, la brecha europea se reduce en generación multimodal: un espacio hasta ahora dominado por EE.UU./China. Segundo, el derivado FLUX-mimic marca un giro: las arquitecturas flow, hasta ahora limitadas a imagen/vídeo, migran hacia la acción robótica. Es exactamente el movimiento anticipado por los actores de la embodied-foundation-race (X-Square, Xiaomi Robotics-U0, Nvidia GR00T): un backbone único común a la percepción, la generación y el control motor.

Escenarios

  • Corto plazo: los benchmarks de terceros (Artificial Analysis, LMArena Vision) resolverán el debate en 4-6 semanas.
  • Medio plazo: BFL se convierte en objetivo de adquisición —Meta, Amazon o un actor estratégico europeo (SAP, Mistral)— si los resultados se mantienen.
  • Alternativo: FLUX-mimic queda en demo. Los benchmarks de robótica carecen de estandarización; la comparación será difícil.

Implicaciones para el profesional

Para un equipo de producto, el anuncio no reemplaza las stacks establecidas (Runway, Pika, Veo) hasta que los benchmarks de terceros estén disponibles. Para un laboratorio de robótica, en cambio, FLUX-mimic merece evaluación seria: es uno de los primeros modelos flow abiertamente orientados a la acción, en un momento en que la industria oscila entre difusión, VLA y RT-2.

Señales a vigilar

  • Publicación de un informe técnico (paper o entrada de blog detallada).
  • Apertura de acceso API vs. pesos abiertos (BFL tiene un historial mixto).
  • Reacciones de ByteDance (Seedance) y Google (Gemini Omni) ante los benchmarks cuestionados.

Nuestra lectura

BFL apuesta fuerte. La promesa es atractiva, pero la demostración técnica aún debe confirmarse. Lo que ya es claro: el flow multimodal ya no es una nicho de imagen —se perfila como candidato creíble para ser el backbone universal entre percepción, generación y acción.

Resources

Artículo producido por inteligencia artificial, revisado bajo control editorial humano.

Nuestra redacción
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
¿Te ha resultado útil este artículo?

9 personas han valorado este artículo

Me gusta
P
Priya RamanMachine Learning Engineer
🇬🇧 ML engineer, applied research.
Compartir:
Comentarios (8)

Inicia sesión para unirte a la conversación.

J.P.R. 2 24 Jul 2026 · 17:24

I wonder if FLUX 3's multimodal approach could lead to overfitting in specific robotic tasks. How does it handle edge cases?

J.P.R. 3 24 Jul 2026 · 17:20

I'd like to see a direct comparison of FLUX 3's performance against Gemini Omni in real-world robotic applications, not just benchmarks.

Dr. J. 24 Jul 2026 · 16:46

I'm curious about the real-time processing capabilities of the video-action derivative. Can it handle latency issues in robotic applications?

FoodieFiona 2 24 Jul 2026 · 08:21

I'm intrigued by the video-action derivative for robotics. Hope it can handle real-time decision making.

Alex_LDN 24 Jul 2026 · 07:32

Excited to see how FLUX 3's multimodal capabilities translate into robotics. Wondering if it can outperform Gemini Omni in complex tasks.

unLecteurCurieux 24 Jul 2026 · 07:27

I wonder how FLUX 3's video-action derivative will handle complex robotic tasks. Will it be more efficient than existing solutions?

curio_usa 24 Jul 2026 · 07:04

I'm curious to see how FLUX 3 compares to Seedance 2.0 in real-world applications. Any benchmarks yet?

EcoWarrior99 24 Jul 2026 · 06:58

While the multimodal capabilities are impressive, I wonder about the environmental impact of developing and deploying such advanced AI models.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secciones
Explorar
Información