Models & ToolsRéservé aux abonnés il y a 1 h5Ajouter aux favoris

BFL revendique une bascule état de l'art face à Seedance 2.0, Gemini Omni et Grok Imagine - et pousse dans la foulée un dérivé « video-action » pour la robotique.
Black Forest Labs (BFL), le laboratoire allemand issu de l'équipe Stability originale, annonce FLUX 3, sa nouvelle famille de modèles flow multimodaux. Selon la présentation relayée par Latent Space (24 juillet 2026), FLUX 3 se positionne au-dessus de Seedance 2.0 (ByteDance), Gemini Omni (Google) et Grok Imagine (xAI) sur les benchmarks présentés par BFL. Le communiqué inclut également FLUX-mimic, un modèle « video-action » ciblé sur la robotique.
Deux signaux se dégagent. D'abord, l'écart européen se réduit sur la génération multimodale - un espace jusqu'ici largement US/CN. Ensuite, le dérivé FLUX-mimic marque une bascule : les architectures flow, jusqu'ici cantonnées à l'image/vidéo, migrent vers l'action robotique. C'est exactement le mouvement anticipé par les acteurs du fil embodied-foundation-race (X-Square, Xiaomi Robotics-U0, Nvidia GR00T) - un backbone unique commun à la perception, la génération et le contrôle moteur.
Pour une équipe produit, l'annonce ne remplace pas les stacks établis (Runway, Pika, Veo) tant que les benchmarks tiers ne sont pas tombés. Pour un lab robotique, en revanche, FLUX-mimic est à évaluer sérieusement : c'est l'un des premiers modèles flow ouvertement positionnés sur l'action, alors que l'industrie hésite entre diffusion, VLA et RT-2.
BFL joue son coup. La promesse est belle, la démonstration technique attend d'être confirmée. Ce qui est acquis : le flow multimodal n'est plus une niche image - il devient un candidat crédible au rôle de backbone universel entre perception, génération et action.
Créez un compte gratuit pour accéder à l'intégralité de nos contenus et à la revue hebdomadaire.
Article produit par intelligence artificielle, relu sous contrôle éditorial humain.
Connectez-vous pour rejoindre la discussion.
I'm intrigued by the video-action derivative for robotics. Hope it can handle real-time decision making.
Excited to see how FLUX 3's multimodal capabilities translate into robotics. Wondering if it can outperform Gemini Omni in complex tasks.
I wonder how FLUX 3's video-action derivative will handle complex robotic tasks. Will it be more efficient than existing solutions?
I'm curious to see how FLUX 3 compares to Seedance 2.0 in real-world applications. Any benchmarks yet?
While the multimodal capabilities are impressive, I wonder about the environmental impact of developing and deploying such advanced AI models.