Horizonte Jul 30, 2026 at 19:4012Adicionar aos favoritos

A atualização ER 2 da DeepMind impulsiona o raciocínio incorporado em direção à compreensão de vídeos e à coordenação em nível de frota - a corrida por fundações incorporadas ganha seu marco com a marca Google.
Em termos simples. O Google DeepMind lançou o Gemini Robotics ER 2, adicionando compreensão de vídeo, orquestração de tarefas e colaboração multi-robô à sua pilha incorporada. O passo do demo de braço único para o raciocínio em nível de frota é a verdadeira novidade e coloca a Alphabet visivelmente de volta na corrida das fundações incorporadas.
O fio das fundações incorporadas tem sido, até agora, impulsionado por três atores: NVIDIA GR00T, o Xiaomi Robotics-U0 da China (38B, open source) e a aposta no backbone da X-Square Robot. A linha ER da Alphabet era a "dorminhoca". O ER 2 é a DeepMind reafirmando que está na ativa.
De acordo com o anúncio, o ER 2 enfatiza três pontos concretos:
Os dois primeiros seguem a direção pública do setor desde 2025. O terceiro é onde está a diferenciação. Coordenar dois braços em um único robô é um problema de controle; coordenar dois robôs em um único trabalho é um problema de sistemas - modelo de mundo compartilhado, comunicação, resolução de conflitos.
O anúncio não publica benchmarks comparativos contra o GR00T ou RT-2 nas mesmas tarefas e não quantifica a "colaboração" (latência, horizonte de coordenação, modos de falha). Considere isso como uma capacidade anunciada, não comprovada, até que terceiros reproduzam.
Para um tomador de decisão: este é um forte sinal de que a pilha incorporada está seguindo o padrão de LLMs - um backbone único, adaptável a diferentes formatos. Orce-se para um mercado onde a camada de middleware se reduz a uma chamada de modelo. Para um desenvolvedor: observe a superfície da API. Se o ER 2 for acessível fora das equipes internas de robótica da Alphabet, o ponto de integração para automação física pode mudar em dezoito meses. Para o setor: a divisão visível agora está entre a estratégia fechada do Google no topo e a aposta aberta de peso de 38B da Xiaomi (Robotics-U0) na base. Se essa divisão se amplia - com mais laboratórios chineses escolhendo a rota de peso aberto como a Xiaomi fez - é a história a ser observada até o final de 2026.
Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.
Inicie sessão para se juntar à discussão.
The shift to video-native systems feels inevitable, but I’m skeptical about the scalability. How will it handle low-light conditions or high-contrast scenes without becoming computationally prohibitive?
Wouldn’t a video-native approach limit the robots to environments where cameras are reliable? What happens when lighting fails or sensors get obscured?
I wonder how this tech will handle the coordination of robots with different capabilities and limitations. It's a complex challenge.
It's a tough nut to crack, but DeepMind's track record in AI gives me hope they'll nail it.
I'm curious about the ethical implications of fleet-level robot coordination. How will we ensure transparency and accountability in their decision-making processes?
Good question, transparency could be achieved through open-source algorithms and regular audits by independent bodies.
I'm excited about the potential for video-native understanding, but how will it handle occlusions and dynamic environments? Real-world complexity is a beast.
I hope this tech can bridge the gap between lab demos and real-world applications. The potential is huge, but the challenges are real.
I wonder how this tech will handle the coordination of robots with different capabilities and limitations. It's a complex challenge.
The video-native approach is intriguing, but I wonder how it will handle low-light or high-speed scenarios. Real-world applications are messy!
I'm curious about the scalability of this system. How will it handle diverse environments and tasks beyond lab settings?
I wonder how this tech will handle dynamic environments with unpredictable human interactions. Real-world applications are complex.
I'm excited about the multi-robot coordination aspect. Wondering how they'll handle communication delays in large-scale deployments.
DeepMind's ER 2 update is a significant step forward in embodied reasoning. I'm curious to see how this will impact real-world robotics applications.
Course aux modèles fondation embodied : X-Square, Xiaomi, GR00T