Horizonte Aug 25, 2026 at 16:278Añadir a favoritos

X Square apuntó específicamente al benchmark publicado por Figure AI sobre tareas de manipulación robótica y luego afirmó haberlo superado en un 45%. Sumado al rendimiento de Wall-B en clasificación con un 70% menos de costo en hardware, la capacidad de LimX Dynamics equiparable a la de Figure y Tiangong Omni obteniendo la máxima puntuación en tareas laborales, el patrón es estructuralmente claro: los laboratorios chinos de robots humanoides están aplicando una compresión de capacidad por dólar que refleja lo que DeepSeek hizo con GPT-4.
Figure AI es una de las empresas de robótica mejor financiadas del Silicon Valley. X Square es un competidor chino que utilizó específicamente el propio benchmark publicado de Figure para probar su robot y afirma haberlo superado en un 45%. Este es el tercer o cuarto dato en un patrón: los laboratorios chinos de robots humanoides están superando sistemáticamente a sus homólogos occidentales en costos y, cada vez más, en métricas de capacidad publicadas.
El enfoque de X Square —explicitamente dirigido a un benchmark publicado por un competidor— es una señal competitiva específica. Dice: creemos que podemos superar su número y queremos que el mercado lo sepa.
El informe de Pandaily hace verificable la afirmación con números específicos: X Square clasificó 1.816 paquetes en una hora sin editar utilizando pinzas simples. El objetivo que se propuso —1.248— resulta ser el promedio horario sostenido de Figure AI, por paquete. Eso es 1.816 / 1.248 = 45,6% por encima del benchmark de Figure, en un video sin editar en una sola toma.
Dos cosas hacen que esta afirmación sea más sólida que las típicas afirmaciones de benchmarks: la tarea (clasificación de paquetes) es concreta y medible, y el marco de "sin editar" es una respuesta directa a las críticas sobre edición que suelen recibir las demostraciones de robots humanoides.
DeepSeek demostró en modelos de lenguaje que la ingeniería enfocada y el entrenamiento eficiente pueden cerrar una gran brecha de capacidad con empresas que gastan 10× más, en un plazo más corto. El paralelo en inteligencia incorporada: X Square, LimX Dynamics, Unitree y Tiangong están demostrando que la misma dinámica se aplica a la IA física. La pregunta es si se mantiene a escala de implementación y en entornos operativos reales, no solo en benchmarks de clasificación de paquetes.
La afirmación de X Square no llegó de forma aislada. En el mismo período se anunció: Tiangong Omni obtuvo la máxima puntuación en tareas laborales estándar (1,35 m, 39 kg, benchmark de tarea completa); LimX Dynamics demostró un robot que rivaliza con las capacidades de Figure a un costo de hardware sustancialmente menor; WRC 2026 mostró más de 300 empresas activas en el ecosistema chino de inteligencia incorporada.
El bucle de competencia avanza más rápido que el ciclo de anuncios.
La respuesta de Figure a este tipo de presión en benchmarks es crucial. Opciones: publicar nuevos resultados que demuestren un rendimiento que los desafiantes no hayan igualado; cambiar el marco competitivo de los benchmarks al volumen de implementación (más difícil de falsificar, más significativo comercialmente); o acelerar el plan en capacidades específicas donde la brecha es real.
El peor escenario para Figure: verse arrastrada a una carrera de benchmarks que no diseñó, en métricas que favorecen a los desafiantes, mientras que los clientes de implementación se preocupan por cosas completamente diferentes.
La brecha de capacidad en robots humanoides entre China y EE.UU. se está cerrando más rápido en benchmarks que en el tamaño de la flota implementada. La métrica que importa más para la posición en el mercado son las horas operativas reales en entornos reales, no los conteos de paquetes en una demostración. El número que hay que vigilar en los próximos seis meses para Figure es su cantidad de implementaciones, no su puntuación en benchmarks.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
45% faster benchmarks are one thing, but until we see these robots stacking a real dishwasher or assisting an elderly person, the real test remains unseen. Hardware savings matter, but safety and adaptability will decide if this tech ever leaves the lab.
45% faster benchmarks sound impressive, but how do they translate into consistent performance in dynamic kitchen environments where even a slight spill can throw off a whole sequence?
Hardware cost savings are great, but 45% faster benchmarks won't mean much if the robots can't handle messy real-world tasks like tying shoes or handling wet towels.
This is huge! If true, this could really shake up the humanoid robotics space. But I still wonder about real-world performance outside of benchmarks.
The benchmark race is getting wild, but I’m more curious about long-term robustness than raw percentages. Can these gains hold up after months of real-world use?
45% faster benchmarks are impressive, but how does this translate to tasks humans actually care about? Real-world adaptability seems like the next hurdle.
45% benchmark boost sounds promising, but how replicable is this under different tasks? Hardware cost savings are good, but do they trade off against precision or adaptability in unstructured environments?
Sounds impressive, but without third-party validation, these numbers could be smoke and mirrors. Hardware savings matter, but stability and scalability in real environments will tell the real story.
Course aux modèles fondation embodied : X-Square, Xiaomi, GR00T