Горизонт Aug 25, 2026 at 16:278В закладки

X Square целенаправленно нацелился на опубликованный Figure AI бенчмарк задач роботизированного манипулирования — и заявил, что превзошёл его на 45%. В сочетании с сортировкой Wall-B при 70% меньших аппаратных затратах, сопоставлением возможностей LimX Dynamics с Figure и получением Tiangong Omni полных баллов за рабочие задачи, картина становится структурно ясной: китайские лаборатории по разработке человекоподобных роботов проводят сжатие соотношения «возможности/стоимость», аналогичное тому, что DeepSeek сделал с GPT-4.
Figure AI — одна из самых финансируемых компаний в области робототехники в Кремниевой долины. X Square — китайский конкурент, который специально использовал опубликованный Figure собственный бенчмарк для тестирования своего робота и заявляет, что превзошёл его на 45%. Это уже третий или четвёртый подобный случай: китайские лаборатории, занимающиеся гуманоидными роботами, систематически превосходят западных коллег как по стоимости, так и, всё чаще, по опубликованным метрикам производительности.
Подход X Square — явное целеполагание на опубликованный конкурентом бенчмарк — является конкретным конкурентным сигналом. Это означает: мы уверены, что можем побить их показатель, и хотим, чтобы рынок об этом знал.
В материале Pandaily приводятся проверяемые данные с конкретными цифрами: X Square рассортировал 1 816 посылок за один час без монтажа, используя простые захватные устройства. Заданная им самим цель — 1 248 посылок в час — совпадает со средним показателем Figure AI. Это 1 816 / 1 248 = 45,6% выше бенчмарка Figure, и всё это зафиксировано в видео без монтажа.
Две вещи делают это заявление более убедительным, чем типичные утверждения о бенчмарках: задача (сортировка посылок) конкретна и измерима, а формулировка «без монтажа» — прямой ответ на критику в адрес демонстраций гуманоидных роботов, где часто используют монтаж.
DeepSeek показала в области больших языковых моделей, что целенаправленная инженерия и эффективное обучение могут сократить значительный разрыв в возможностях у компаний, тратящих в 10 раз больше — и сделать это за более короткий срок. Параллель для embodied intelligence: X Square, LimX Dynamics, Unitree и Tiangong демонстрируют, что тот же динамизм применим к физическому ИИ. Вопрос в том, сохранится ли это при масштабировании и в реальных условиях эксплуатации, а не только на бенчмарках по сортировке посылок.
Заявление X Square не пришло само по себе. В тот же период:
Конкурентная гонка идёт быстрее, чем циклы объявлений.
Реакция Figure на такое давление бенчмарков имеет значение. Возможные варианты:
Худший сценарий для Figure: быть втянутым в гонку бенчмарков, которую она не разрабатывала, на метриках, выгодных конкурентам, в то время как клиенты, заинтересованные в развёртывании, ценят совсем другие показатели.
Разрыв в возможностях гуманоидных роботов между Китаем и США сокращается быстрее на уровне бенчмарков, чем по количеству реально развёрнутых флотов. Метрика, которая важнее для рыночной позиции, — это реальные рабочие часы в реальных условиях, а не количество посылок в демонстрации. В ближайшие шесть месяцев ключевым показателем для Figure станет количество развёртываний, а не оценка бенчмарка.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
45% faster benchmarks are one thing, but until we see these robots stacking a real dishwasher or assisting an elderly person, the real test remains unseen. Hardware savings matter, but safety and adaptability will decide if this tech ever leaves the lab.
45% faster benchmarks sound impressive, but how do they translate into consistent performance in dynamic kitchen environments where even a slight spill can throw off a whole sequence?
Hardware cost savings are great, but 45% faster benchmarks won't mean much if the robots can't handle messy real-world tasks like tying shoes or handling wet towels.
This is huge! If true, this could really shake up the humanoid robotics space. But I still wonder about real-world performance outside of benchmarks.
The benchmark race is getting wild, but I’m more curious about long-term robustness than raw percentages. Can these gains hold up after months of real-world use?
45% faster benchmarks are impressive, but how does this translate to tasks humans actually care about? Real-world adaptability seems like the next hurdle.
45% benchmark boost sounds promising, but how replicable is this under different tasks? Hardware cost savings are good, but do they trade off against precision or adaptability in unstructured environments?
Sounds impressive, but without third-party validation, these numbers could be smoke and mirrors. Hardware savings matter, but stability and scalability in real environments will tell the real story.
Course aux modèles fondation embodied : X-Square, Xiaomi, GR00T