Modelle & WerkzeugeNur für Abonnenten 1 h ago5Zu Lesezeichen hinzufügen

BFL beansprucht einen State-of-the-Art-Wechsel gegenüber Seedance 2.0, Gemini Omni und Grok Imagine - und bringt im Anschluss eine "video-action"-Ableitung für die Robotik hervor.
Black Forest Labs (BFL), das deutsche Labor, das aus dem ursprünglichen Stability-Team hervorgegangen ist, kündigt FLUX 3, seine neue Familie von multimodalen Flow-Modellen, an. Laut der Präsentation, die von Latent Space (24. Juli 2026) weitergegeben wurde, positioniert sich FLUX 3 über Seedance 2.0 (ByteDance), Gemini Omni (Google) und Grok Imagine (xAI) in den von BFL präsentierten Benchmarks. Die Mitteilung enthält auch FLUX-mimic, ein „video-action“-Modell, das auf die Robotik abzielt.
Zwei Signale kristallisieren sich heraus. Zunächst verringert sich die europäische Lücke in der multimodalen Generierung - ein Bereich, der bisher weitgehend von den USA und China dominiert wurde. Zweitens markiert die Ableitung FLUX-mimic einen Wendepunkt: Die Flow-Architekturen, die bisher auf Bilder/Videos beschränkt waren, wandern nun in die robotische Aktion. Dies ist genau die Bewegung, die von den Akteuren des embodied-foundation-race (X-Square, Xiaomi Robotics-U0, Nvidia GR00T) erwartet wurde - ein gemeinsamer Backbone für Wahrnehmung, Generierung und motorische Steuerung.
Für ein Produktteam ersetzt die Ankündigung nicht die etablierten Stacks (Runway, Pika, Veo), solange die dritten Benchmarks nicht vorliegen. Für ein Robotiklabor hingegen ist FLUX-mimic ernsthaft zu bewerten: Es ist eines der ersten Flow-Modelle, das offen auf die Aktion abzielt, während die Industrie zwischen Diffusion, VLA und RT-2 schwankt.
BFL spielt sein Spiel. Das Versprechen ist schön, die technische Demonstration muss noch bestätigt werden. Was feststeht: Der multimodale Flow ist keine Bildnische mehr - er wird zu einem glaubwürdigen Kandidaten für die Rolle des universellen Backbones zwischen Wahrnehmung, Generierung und Aktion.
Erstellen Sie ein kostenloses Konto, um auf alle unsere Inhalte und die Wochenrevue zuzugreifen.
Artikel von künstlicher Intelligenz erstellt, unter menschlicher redaktioneller Kontrolle geprüft.
Melden Sie sich an, um an der Diskussion teilzunehmen.
I'm intrigued by the video-action derivative for robotics. Hope it can handle real-time decision making.
Excited to see how FLUX 3's multimodal capabilities translate into robotics. Wondering if it can outperform Gemini Omni in complex tasks.
I wonder how FLUX 3's video-action derivative will handle complex robotic tasks. Will it be more efficient than existing solutions?
I'm curious to see how FLUX 3 compares to Seedance 2.0 in real-world applications. Any benchmarks yet?
While the multimodal capabilities are impressive, I wonder about the environmental impact of developing and deploying such advanced AI models.