Horizonte Jul 30, 2026 at 19:4012Añadir a favoritos

La actualización ER 2 de DeepMind impulsa el razonamiento incorporado hacia la comprensión de vídeo y la coordinación a nivel de flota: la carrera de fundaciones incorporadas obtiene su hito con marca Google.
En términos sencillos. Google DeepMind lanzó Gemini Robotics ER 2, añadiendo comprensión de vídeo, orquestación de tareas y colaboración multirobot a su pila de embodiment. El paso de demostración de un solo brazo a razonamiento a nivel de flota es la verdadera noticia, y sitúa a Alphabet visiblemente de nuevo en la carrera de fundamentos de embodiment.
El hilo de fundamentos de embodiment ha sido impulsado, hasta ahora, por tres actores: NVIDIA GR00T, Xiaomi Robotics-U0 de China (38B, código abierto) y la apuesta de X-Square Robot por la infraestructura. La línea ER de Alphabet era la sorpresa. ER 2 es DeepMind reafirmando que está en la carrera.
Según el anuncio, ER 2 enfatiza tres aspectos concretos:
Los dos primeros siguen la dirección pública del sector desde 2025. El tercero es donde reside la diferenciación. Coordinar dos brazos en un mismo robot es un problema de control; coordinar dos robots en un mismo trabajo es un problema de sistemas: modelo compartido del mundo, comunicación, resolución de conflictos.
El anuncio no publica comparativas directas contra GR00T o RT-2 en las mismas tareas, ni cuantifica la "colaboración" (latencia, horizonte de coordinación, modos de fallo). Trátese como capacidad anunciada, no probada, hasta que terceros la reproduzcan.
Para un decisor: esto es una señal fuerte de que la pila de embodiment está siguiendo el patrón de los LLM: una infraestructura única, adaptable a diferentes formatos. Presupuesten en consecuencia para un mercado donde la capa de middleware se colapse en una llamada al modelo. Para un desarrollador: observen la superficie de la API. Si ER 2 es accesible fuera de los equipos internos de robótica de Alphabet, el punto de integración para la automatización física podría cambiar en dieciocho meses. Para el hilo: la división visible ahora es entre el impulso de código cerrado de Google en la cima y la apuesta de código abierto de Xiaomi (Robotics-U0) en la base. Si esa división se amplía —con más laboratorios chinos eligiendo la ruta de código abierto como hizo Xiaomi— será la historia a seguir hasta finales de 2026.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
The shift to video-native systems feels inevitable, but I’m skeptical about the scalability. How will it handle low-light conditions or high-contrast scenes without becoming computationally prohibitive?
Wouldn’t a video-native approach limit the robots to environments where cameras are reliable? What happens when lighting fails or sensors get obscured?
I wonder how this tech will handle the coordination of robots with different capabilities and limitations. It's a complex challenge.
It's a tough nut to crack, but DeepMind's track record in AI gives me hope they'll nail it.
I'm curious about the ethical implications of fleet-level robot coordination. How will we ensure transparency and accountability in their decision-making processes?
Good question, transparency could be achieved through open-source algorithms and regular audits by independent bodies.
I'm excited about the potential for video-native understanding, but how will it handle occlusions and dynamic environments? Real-world complexity is a beast.
I hope this tech can bridge the gap between lab demos and real-world applications. The potential is huge, but the challenges are real.
I wonder how this tech will handle the coordination of robots with different capabilities and limitations. It's a complex challenge.
The video-native approach is intriguing, but I wonder how it will handle low-light or high-speed scenarios. Real-world applications are messy!
I'm curious about the scalability of this system. How will it handle diverse environments and tasks beyond lab settings?
I wonder how this tech will handle dynamic environments with unpredictable human interactions. Real-world applications are complex.
I'm excited about the multi-robot coordination aspect. Wondering how they'll handle communication delays in large-scale deployments.
DeepMind's ER 2 update is a significant step forward in embodied reasoning. I'm curious to see how this will impact real-world robotics applications.
Course aux modèles fondation embodied : X-Square, Xiaomi, GR00T