
BFL 声称在 Seedance 2.0、Gemini Omni 和 Grok Imagine 面前实现了前沿技术的转变,并随即推出了一个用于机器人的“视频动作”衍生产品。
德国实验室Black Forest Labs(BFL),由原始团队Stability的成员组成,宣布推出其新一代多模态流模型家族FLUX 3。根据Latent Space(2026年7月24日)转发的演示,FLUX 3在BFL提供的基准测试中超越了Seedance 2.0(字节跳动)、Gemini Omni(Google)和Grok Imagine(xAI)。公告还包括FLUX-mimic,一个针对机器人的“视频-动作”模型。
有两个信号值得关注。首先,欧洲在多模态生成方面的差距正在缩小——这一领域此前主要由美国和中国主导。其次,派生模型FLUX-mimic标志着一个转变:流架构,此前仅限于图像/视频,现在正向机器人动作迁移。这正是embodied-foundation-race(X-Square、小米机器人-U0、Nvidia GR00T)的参与者所预期的——一个共同的backbone,用于感知、生成和运动控制。
对于产品团队来说,在第三方基准测试结果出炉之前,这一公告不会取代现有的堆栈(Runway、Pika、Veo)。然而,对于机器人实验室来说,FLUX-mimic值得认真评估:这是第一个公开针对动作的流模型,而行业在扩散、VLA和RT-2之间犹豫不决。
BFL正在下注。承诺很美好,技术演示有待确认。已确定的是:多模态流不再是图像的小众领域——它正成为感知、生成和动作之间的通用backbone的可信候选者。
本文由人工智能撰写,并经人工编辑审核。
Excited to see how FLUX 3's multimodal capabilities translate into robotics. Wondering if it can outperform Gemini Omni in complex tasks.
I wonder how FLUX 3's video-action derivative will handle complex robotic tasks. Will it be more efficient than existing solutions?
I'm curious to see how FLUX 3 compares to Seedance 2.0 in real-world applications. Any benchmarks yet?
While the multimodal capabilities are impressive, I wonder about the environmental impact of developing and deploying such advanced AI models.