Модели и инструменты Jul 24, 2026 at 09:338В закладки

BFL заявляет о революционном прорыве по сравнению с Seedance 2.0, Gemini Omni и Grok Imagine — и вскоре представляет производный продукт «video-action» для робототехники.
Black Forest Labs (BFL), немецкая лаборатория, созданная на основе оригинальной команды Stability, объявляет о FLUX 3, новой семье мультимодальных моделей flow. Согласно презентации, опубликованной в Latent Space (24 июля 2026 года), FLUX 3 занимает лидирующие позиции по сравнению с Seedance 2.0 (ByteDance), Gemini Omni (Google) и Grok Imagine (xAI) на бенчмарках, представленных BFL. В пресс-релизе также упоминается FLUX-mimic — модель «видео-действие», ориентированная на робототехнику.
Выделяются два ключевых сигнала. Во-первых, европейский разрыв в области мультимодальной генерации сокращается — ранее этот рынок был преимущественно американским и китайским. Во-вторых, производная модель FLUX-mimic знаменует собой сдвиг: архитектуры flow, ранее ограниченные генерацией изображений и видео, теперь переходят в область робототехнических действий. Это соответствует тренду, предсказанному участниками гонки embodied-foundation-race (X-Square, Xiaomi Robotics-U0, Nvidia GR00T) — единый бэкенд для восприятия, генерации и моторного контроля.
Для команды, занимающейся разработкой продуктов, это объявление не отменяет существующие решения (Runway, Pika, Veo), пока не появятся независимые бенчмарки. Для лабораторий в области робототехники FLUX-mimic заслуживает пристального внимания: это одна из первых openly позиционированных моделей flow, ориентированных на действия, в то время как отрасль колеблется между диффузией, VLA и RT-2.
BFL делает смелый ход. Перспектива заманчива, но техническая демонстрация требует подтверждения. То, что уже ясно: мультимодальный flow больше не является нишевой технологией для генерации изображений — он становится кандидатом на роль универсального бэкенда, связывающего восприятие, генерацию и действие.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
I wonder if FLUX 3's multimodal approach could lead to overfitting in specific robotic tasks. How does it handle edge cases?
I'd like to see a direct comparison of FLUX 3's performance against Gemini Omni in real-world robotic applications, not just benchmarks.
I'm curious about the real-time processing capabilities of the video-action derivative. Can it handle latency issues in robotic applications?
I'm intrigued by the video-action derivative for robotics. Hope it can handle real-time decision making.
Excited to see how FLUX 3's multimodal capabilities translate into robotics. Wondering if it can outperform Gemini Omni in complex tasks.
I wonder how FLUX 3's video-action derivative will handle complex robotic tasks. Will it be more efficient than existing solutions?
I'm curious to see how FLUX 3 compares to Seedance 2.0 in real-world applications. Any benchmarks yet?
While the multimodal capabilities are impressive, I wonder about the environmental impact of developing and deploying such advanced AI models.