Black Forest Labs lança o FLUX 3: um modelo flow multimodal que se expande para a robótica

Modelos e Ferramentas Jul 24, 2026 at 09:338Adicionar aos favoritos

Black Forest Labs lança o FLUX 3: um modelo flow multimodal que se expande para a robótica
Ilustração : Léa Fontaine

BFL reivindica uma mudança de paradigma de ponta em comparação com Seedance 2.0, Gemini Omni e Grok Imagine - e lança em seguida um derivado "video-ação" para robótica.

Contexto

Black Forest Labs (BFL), o laboratório alemão originário da equipe original da Stability, anuncia o FLUX 3, sua nova família de modelos flow multimodais. Segundo a apresentação divulgada pelo Latent Space (24 de julho de 2026), o FLUX 3 se posiciona acima do Seedance 2.0 (ByteDance), do Gemini Omni (Google) e do Grok Imagine (xAI) nos benchmarks apresentados pela BFL. O comunicado também inclui o FLUX-mimic, um modelo de "video-ação" voltado para a robótica.

Os dados

  • Família anunciada: FLUX 3 (flow multimodal).
  • Concorrentes citados pela BFL: Seedance 2.0, Gemini Omni, Grok Imagine.
  • Derivado: FLUX-mimic - modelo de vídeo-ação para robótica.
  • Fonte: Latent Space, 24 de julho de 2026 (benchmarks a serem validados por terceiros).

Análise

Dois sinais se destacam. Primeiro, a lacuna europeia na geração multimodal está se reduzindo — um espaço até então dominado por EUA/China. Em segundo lugar, o derivado FLUX-mimic marca uma mudança: as arquiteturas flow, até agora restritas a imagem/vídeo, migram para a ação robótica. Esse é exatamente o movimento antecipado pelos atores da embodied-foundation-race (X-Square, Xiaomi Robotics-U0, Nvidia GR00T) — um backbone único comum à percepção, geração e controle motor.

Cenários

  • Curto prazo: os benchmarks de terceiros (Artificial Analysis, LMArena Vision) decidirão o debate em 4-6 semanas.
  • Médio prazo: a BFL se torna alvo de aquisição — Meta, Amazon ou um estratégico europeu (SAP, Mistral) — se os resultados se mantiverem.
  • Alternativo: o FLUX-mimic permanece como demonstração. Os benchmarks de robótica carecem de padronização, dificultando a comparação.

Implicações para o profissional

Para uma equipe de produto, o anúncio não substitui as stacks estabelecidas (Runway, Pika, Veo) até que os benchmarks de terceiros sejam divulgados. Para um laboratório de robótica, no entanto, o FLUX-mimic deve ser seriamente avaliado: é um dos primeiros modelos flow abertamente posicionados na ação, enquanto a indústria hesita entre difusão, VLA e RT-2.

Sinais a monitorar

  • Publicação de um relatório técnico (paper ou post detalhado no blog).
  • Abertura de acesso via API vs. pesos abertos (a BFL tem histórico misto).
  • Reações da ByteDance (Seedance) e Google (Gemini Omni) aos benchmarks contestados.

Nossa leitura

A BFL está jogando suas cartas. A promessa é atraente, mas a demonstração técnica ainda precisa ser confirmada. O que já está claro: o flow multimodal não é mais uma nicho de imagem — ele se torna um candidato credível ao papel de backbone universal entre percepção, geração e ação.

Resources

Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.

A nossa redação
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Este artigo foi-lhe útil?

9 pessoas gostaram deste artigo

Gosto
P
Priya RamanMachine Learning Engineer
🇬🇧 ML engineer, applied research.
Partilhar:
Comentários (8)

Inicie sessão para se juntar à discussão.

J.P.R. 2 24 Jul 2026 · 17:24

I wonder if FLUX 3's multimodal approach could lead to overfitting in specific robotic tasks. How does it handle edge cases?

J.P.R. 3 24 Jul 2026 · 17:20

I'd like to see a direct comparison of FLUX 3's performance against Gemini Omni in real-world robotic applications, not just benchmarks.

Dr. J. 24 Jul 2026 · 16:46

I'm curious about the real-time processing capabilities of the video-action derivative. Can it handle latency issues in robotic applications?

FoodieFiona 2 24 Jul 2026 · 08:21

I'm intrigued by the video-action derivative for robotics. Hope it can handle real-time decision making.

Alex_LDN 24 Jul 2026 · 07:32

Excited to see how FLUX 3's multimodal capabilities translate into robotics. Wondering if it can outperform Gemini Omni in complex tasks.

unLecteurCurieux 24 Jul 2026 · 07:27

I wonder how FLUX 3's video-action derivative will handle complex robotic tasks. Will it be more efficient than existing solutions?

curio_usa 24 Jul 2026 · 07:04

I'm curious to see how FLUX 3 compares to Seedance 2.0 in real-world applications. Any benchmarks yet?

EcoWarrior99 24 Jul 2026 · 06:58

While the multimodal capabilities are impressive, I wonder about the environmental impact of developing and deploying such advanced AI models.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secções
Explorar
Informações