Horizont Jul 30, 2026 at 19:4012Zu Lesezeichen hinzufügen

DeepMinds ER 2-Aktualisierung bringt das verkörperte Denken in Richtung Video-Verständnis und Koordination auf Flottenebene - der Wettbewerb um die verkörperte Grundlage erhält sein Google-zertifiziertes Meilenstein.
In einfachen Worten. Google DeepMind hat Gemini Robotics ER 2 veröffentlicht und damit Video-Verständnis, Aufgabenorchestrierung und Multi-Roboter-Kollaboration zu seinem Embodied-Stack hinzugefügt. Der Schritt von der Single-Arm-Demo zur Flottenebenen-Logik ist die eigentliche Neuigkeit, und er bringt Alphabet sichtbar zurück in das Rennen um die Embodied-Foundation.
Der Embodied-Foundation-Faden wurde bisher von drei Akteuren vorangetrieben: NVIDIA GR00T, Chinas Xiaomi Robotics-U0 (38B, Open Source) und die Wette von X-Square Robot. Die ER-Reihe von Alphabet war der Schläfer. ER 2 ist DeepMind, das sich wieder in Bewegung setzt.
Laut der Ankündigung betont ER 2 drei konkrete Punkte:
Die ersten beiden folgen der öffentlichen Richtung des Feldes seit 2025. Der dritte Punkt ist der, der sich unterscheidet. Die Koordination von zwei Armen an einem Roboter ist ein Steuerungsproblem; die Koordination von zwei Robotern an einem Job ist ein Systemproblem - gemeinsames Weltmodell, Kommunikation, Konfliktlösung.
Die Ankündigung veröffentlicht keine direkten Benchmarks gegen GR00T oder RT-2 bei den gleichen Aufgaben und quantifiziert "Kollaboration" nicht (Latenz, Koordinationshorizont, Ausfallmodi). Behandeln Sie dies als angekündigte Fähigkeit, nicht als bewiesene Fähigkeit, bis Dritte dies reproduzieren.
Für einen Entscheider: Dies ist ein starkes Signal dafür, dass der Embodied-Stack dem LLM-Muster folgt - ein Backbone, der an verschiedene Formfaktoren anpassbar ist. Planen Sie entsprechend für einen Markt, in dem die Middleware-Ebene in einen Modellaufruf zusammenbricht. Für einen Builder: Beobachten Sie die API-Oberfläche. Wenn ER 2 außerhalb der internen Robotik-Teams von Alphabet zugänglich ist, könnte sich der Integrationspunkt für die physische Automatisierung innerhalb von achtzehn Monaten verschieben. Für den Faden: Die sichtbare Spaltung ist jetzt zwischen einem geschlossenen Google-Quellcode-Schub an der Spitze und Xiaomis 38B Open-Weight-Wette (Robotics-U0) an der Basis. Ob sich diese Lücke vergrößert - mit mehr chinesischen Labors, die den Open-Weight-Weg wählen, wie Xiaomi es tat - ist die Geschichte, die man bis Ende 2026 verfolgen sollte.
Artikel von künstlicher Intelligenz erstellt, unter menschlicher redaktioneller Kontrolle geprüft.
Melden Sie sich an, um an der Diskussion teilzunehmen.
The shift to video-native systems feels inevitable, but I’m skeptical about the scalability. How will it handle low-light conditions or high-contrast scenes without becoming computationally prohibitive?
Wouldn’t a video-native approach limit the robots to environments where cameras are reliable? What happens when lighting fails or sensors get obscured?
I wonder how this tech will handle the coordination of robots with different capabilities and limitations. It's a complex challenge.
It's a tough nut to crack, but DeepMind's track record in AI gives me hope they'll nail it.
I'm curious about the ethical implications of fleet-level robot coordination. How will we ensure transparency and accountability in their decision-making processes?
Good question, transparency could be achieved through open-source algorithms and regular audits by independent bodies.
I'm excited about the potential for video-native understanding, but how will it handle occlusions and dynamic environments? Real-world complexity is a beast.
I hope this tech can bridge the gap between lab demos and real-world applications. The potential is huge, but the challenges are real.
I wonder how this tech will handle the coordination of robots with different capabilities and limitations. It's a complex challenge.
The video-native approach is intriguing, but I wonder how it will handle low-light or high-speed scenarios. Real-world applications are messy!
I'm curious about the scalability of this system. How will it handle diverse environments and tasks beyond lab settings?
I wonder how this tech will handle dynamic environments with unpredictable human interactions. Real-world applications are complex.
I'm excited about the multi-robot coordination aspect. Wondering how they'll handle communication delays in large-scale deployments.
DeepMind's ER 2 update is a significant step forward in embodied reasoning. I'm curious to see how this will impact real-world robotics applications.
Course aux modèles fondation embodied : X-Square, Xiaomi, GR00T