Горизонт Jul 30, 2026 at 19:4012В закладки

DeepMind обновляет ER 2, продвигая воплощённое мышление в сторону понимания видео и координации на уровне флота — гонка за воплощёнными фундаментальными моделями получает новый этап от Google.
Простыми словами. Google DeepMind выпустила Gemini Robotics ER 2, добавив понимание видео, оркестровку задач и совместную работу нескольких роботов в свой стек для воплощённого ИИ. Настоящая новость — переход от демонстрации работы одной руки к рассуждениям на уровне флота, что явно возвращает Alphabet в гонку за создание фундаментальных решений для воплощённого ИИ.
До сих пор в гонке за создание фундаментальных решений для воплощённого ИИ лидировали три игрока: NVIDIA GR00T, китайская Xiaomi Robotics-U0 (38B, с открытым исходным кодом) и X-Square Robot с поддержкой базовой архитектуры. Линейка ER от Alphabet была в тени. ER 2 — это DeepMind, подтверждающая, что она всё ещё в игре.
Согласно объявлению, ER 2 делает акцент на трёх ключевых компонентах:
Первые два направления следуют общедоступному тренду в отрасли с 2025 года. Третье — вот где ER 2 выделяется. Координация двух рук на одном роботе — это задача управления; координация двух роботов на одной задаче — это системная задача: общая модель мира, коммуникация, разрешение конфликтов.
В объявлении не приводятся сравнительные бенчмарки с GR00T или RT-2 на одних и тех же задачах, а также не количественно оценивается "совместная работа" (задержки, горизонт координации, режимы отказа). Пока это объявление о возможностях, а не подтверждённая эффективность, пока третьи стороны не воспроизведут результаты.
Для лица, принимающего решения: это сильный сигнал, что стек для воплощённого ИИ следует модели LLM — одна базовая модель, адаптируемая под разные форм-факторы. Соответственно распределяйте бюджет на рынок, где промежуточный слой ПО сведётся к вызову модели. Для разработчика: следите за поверхностью API. Если ER 2 станет доступна за пределами внутренних команд Alphabet по робототехнике, точка интеграции для автоматизации физических процессов может сместиться в течение полутора лет. Для отрасли: теперь видимое разделение проходит между закрытым решением Google на вершине и открытой моделью Xiaomi весом 38B (Robotics-U0) в основе. Расширится ли этот разрыв — с большим количеством китайских лабораторий, выбирающих открытые модели, как это сделала Xiaomi, — это история, за которой стоит наблюдать до конца 2026 года.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
The shift to video-native systems feels inevitable, but I’m skeptical about the scalability. How will it handle low-light conditions or high-contrast scenes without becoming computationally prohibitive?
Wouldn’t a video-native approach limit the robots to environments where cameras are reliable? What happens when lighting fails or sensors get obscured?
I wonder how this tech will handle the coordination of robots with different capabilities and limitations. It's a complex challenge.
It's a tough nut to crack, but DeepMind's track record in AI gives me hope they'll nail it.
I'm curious about the ethical implications of fleet-level robot coordination. How will we ensure transparency and accountability in their decision-making processes?
Good question, transparency could be achieved through open-source algorithms and regular audits by independent bodies.
I'm excited about the potential for video-native understanding, but how will it handle occlusions and dynamic environments? Real-world complexity is a beast.
I hope this tech can bridge the gap between lab demos and real-world applications. The potential is huge, but the challenges are real.
I wonder how this tech will handle the coordination of robots with different capabilities and limitations. It's a complex challenge.
The video-native approach is intriguing, but I wonder how it will handle low-light or high-speed scenarios. Real-world applications are messy!
I'm curious about the scalability of this system. How will it handle diverse environments and tasks beyond lab settings?
I wonder how this tech will handle dynamic environments with unpredictable human interactions. Real-world applications are complex.
I'm excited about the multi-robot coordination aspect. Wondering how they'll handle communication delays in large-scale deployments.
DeepMind's ER 2 update is a significant step forward in embodied reasoning. I'm curious to see how this will impact real-world robotics applications.
Course aux modèles fondation embodied : X-Square, Xiaomi, GR00T