黑森林实验室发布FLUX 3:一个超越机器人的多模态流模型

模型与工具仅限订阅用户 1 h ago5加入收藏

黑森林实验室发布FLUX 3:一个超越机器人的多模态流模型
Illustration : Léa Fontaine

BFL 声称在 Seedance 2.0、Gemini Omni 和 Grok Imagine 面前实现了前沿技术的转变,并随即推出了一个用于机器人的“视频动作”衍生产品。

背景

德国实验室Black Forest Labs(BFL),由原始团队Stability的成员组成,宣布推出其新一代多模态流模型家族FLUX 3。根据Latent Space(2026年7月24日)转发的演示,FLUX 3在BFL提供的基准测试中超越了Seedance 2.0(字节跳动)、Gemini Omni(Google)和Grok Imagine(xAI)。公告还包括FLUX-mimic,一个针对机器人的“视频-动作”模型。

数据

  • 公布的家族:FLUX 3(多模态流)。
  • BFL提到的竞争对手:Seedance 2.0、Gemini Omni、Grok Imagine。
  • 派生模型:FLUX-mimic - 用于机器人的视频-动作模型。
  • 源:Latent Space,2026年7月24日(基准测试需由第三方验证)。

分析

有两个信号值得关注。首先,欧洲在多模态生成方面的差距正在缩小——这一领域此前主要由美国和中国主导。其次,派生模型FLUX-mimic标志着一个转变:流架构,此前仅限于图像/视频,现在正向机器人动作迁移。这正是embodied-foundation-race(X-Square、小米机器人-U0、Nvidia GR00T)的参与者所预期的——一个共同的backbone,用于感知、生成和运动控制。

场景

  • 短期:第三方基准测试(Artificial Analysis、LMArena Vision)将在4-6周内决定胜负。
  • 中期:如果结果持续,BFL将成为收购目标——Meta、Amazon或欧洲战略公司(SAP、Mistral)。
  • 替代方案:FLUX-mimic可能只是一个演示。机器人基准测试缺乏标准化,比较将会困难。

对专业人士的影响

对于产品团队来说,在第三方基准测试结果出炉之前,这一公告不会取代现有的堆栈(Runway、Pika、Veo)。然而,对于机器人实验室来说,FLUX-mimic值得认真评估:这是第一个公开针对动作的流模型,而行业在扩散、VLA和RT-2之间犹豫不决。

需要关注的信号

  • 发布技术报告(详细的论文或博客文章)。
  • 开放API访问与开放权重(BFL的历史混合)。
  • 字节跳动(Seedance)和Google(Gemini Omni)对争议基准测试的反应。

我们的看法

BFL正在下注。承诺很美好,技术演示有待确认。已确定的是:多模态流不再是图像的小众领域——它正成为感知、生成和动作之间的通用backbone的可信候选者。

内容仅限会员访问

免费创建账户,即可访问我们的全部内容和每周评论。

本文由人工智能撰写,并经人工编辑审核。

我们的编辑部
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
这篇文章对您有帮助吗?

5 人赞了这篇文章

P
Priya Raman机器学习工程师
🇨🇳 机器学习工程师,应用研究
分享:
评论 (5)

登录后即可参与讨论。

FoodieFiona 2 24 Jul 2026 · 08:21

I'm intrigued by the video-action derivative for robotics. Hope it can handle real-time decision making.

Alex_LDN 24 Jul 2026 · 07:32

Excited to see how FLUX 3's multimodal capabilities translate into robotics. Wondering if it can outperform Gemini Omni in complex tasks.

unLecteurCurieux 24 Jul 2026 · 07:27

I wonder how FLUX 3's video-action derivative will handle complex robotic tasks. Will it be more efficient than existing solutions?

curio_usa 24 Jul 2026 · 07:04

I'm curious to see how FLUX 3 compares to Seedance 2.0 in real-world applications. Any benchmarks yet?

EcoWarrior99 24 Jul 2026 · 06:58

While the multimodal capabilities are impressive, I wonder about the environmental impact of developing and deploying such advanced AI models.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
主题
浏览
信息