지평 Aug 25, 2026 at 16:278북마크에 추가

X Square는 Figure AI가 발표한 로봇 조작 작업 벤치마크를 구체적으로 겨냥했으며, 이를 45% 향상했다고 주장했습니다. Wall-B가 하드웨어 비용을 70% 절감하며 정렬 작업을 수행하고, LimX Dynamics가 Figure의 능력을 따라잡으며, Tiangong Omni가 작업 과제에서 만점을 받는 등, 그 패턴은 구조적으로 명확합니다: 중국 humanoid 연구소들은 딥시크가 GPT-4에 대해 보여준 것과 같은 '능력당 비용' 압축 전략을 따르고 있습니다.
Figure AI는 실리콘밸리의 가장 잘-funded된 로보틱스 기업 중 하나입니다. X Square는 Figure가 공개한 벤치마크를 직접 사용하여 자체 로봇을 테스트했으며, Figure의 기록을 45%나 앞선다고 주장합니다. 이는 서방 counterparts를 능가하는 중국 humanoid 연구실들의 패턴에서 세 번째 또는 네 번째 데이터 포인트입니다.
X Square의 접근법—명시적으로 경쟁사의 공개 벤치마크를 겨냥한—은 특정 경쟁 신호입니다. 즉, "우리는 그들의 기록을 능가할 수 있다고 믿으며 시장에 알리고자 한다"는 뜻입니다.
판데일리(Pandaily)의 보도에 따르면, X Square는 단 1시간 동안 편집되지 않은 영상에서 단순 집게를 사용해 1,816개의 상자를 분류했다고 주장합니다. X Square가 목표로 삼은 기준인 1,248개는 Figure AI의 시간당 평균 처리량과 정확히 일치합니다. 이는 1,816 / 1,248 = 45.6%에 달하는 수치이며, 편집되지 않은 단일 테이크 영상으로 입증되었습니다.
이 주장이 일반적인 벤치마크 주장보다 강력한 두 가지 이유는: 작업(상자 분류)이 구체적이고 측정 가능하다는 점, 그리고 "편집되지 않음"이라는 프레이밍이 humanoid 로봇 데모에 자주 제기되는 편집 비판에 대한 직접적인 대응이라는 점입니다.
DeepSeek는 LLM 분야에서 집중적인 엔지니어링과 효율적인 훈련이 10배 이상의 예산을 투입한 기업들과의 capability 격차를 좁힐 수 있음을 보여주었습니다—단축된 시간 내에 말이죠. embodied intelligence의 parallels: X Square, LimX Dynamics, Unitree, Tiangong은 동일한 동학이 물리적 AI에도 적용됨을 보여주고 있습니다. 문제는 이 현상이 배포 규모와 실제 운영 환경에서도 통하는가 여부입니다. 단순히 상자 분류 벤치마크에 국한된 것이 아닙니다.
X Square의 주장은 고립된 사건이 아닙니다. 같은 기간에 다음과 같은 소식들이 전해졌습니다: Tiangong Omni가 표준 작업 과제에서 만점(1.35m, 39kg, full-task 벤치마크); LimX Dynamics가 Figure의 capability에 필적하는 로봇을 훨씬 저렴한 하드웨어 비용으로 시연; WRC 2026에서 중국 embodied intelligence 생태계 내 300개 이상의 활발한 기업 활동.
경쟁 루프가 발표 주기보다 더 빠르게 돌아가고 있습니다.
이러한 벤치마크 압력에 대한 Figure의 대응은 중대합니다. 선택지: 도전자들이 따라오지 못한 성능을 입증하는 새로운 결과 발표; 벤치마크 경쟁에서 배포 규모(조작이 어렵고 상업적으로 더 의미 있음)로 경쟁 프레임 전환; 또는 실제 격차가 있는 capability에서 로드맵 가속화.
Figure에 가장 나쁜 결과: Figure가 설계하지 않은 벤치마크 경쟁에 휘말려 도전자들이 유리한 метрикс에 집중하는 동시에, 실제 고객들은 전혀 다른 요소(배포 규모)를 중시하는 상황.
중국과 미국의 humanoid capability 격차는 데모 벤치마크에서보다 실제 배포 규모에서 더 빠르게 좁혀지고 있습니다. 시장에서의 입지를 결정짓는 진정한 мет리크는 데모에서의 상자 개수가 아니라 실제 환경에서의 운영 시간입니다. 다음 6개월간 주목해야 할 Figure의 숫자는 벤치마크 점수가 아니라 배포 규모입니다.
인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.
45% faster benchmarks are one thing, but until we see these robots stacking a real dishwasher or assisting an elderly person, the real test remains unseen. Hardware savings matter, but safety and adaptability will decide if this tech ever leaves the lab.
45% faster benchmarks sound impressive, but how do they translate into consistent performance in dynamic kitchen environments where even a slight spill can throw off a whole sequence?
Hardware cost savings are great, but 45% faster benchmarks won't mean much if the robots can't handle messy real-world tasks like tying shoes or handling wet towels.
This is huge! If true, this could really shake up the humanoid robotics space. But I still wonder about real-world performance outside of benchmarks.
The benchmark race is getting wild, but I’m more curious about long-term robustness than raw percentages. Can these gains hold up after months of real-world use?
45% faster benchmarks are impressive, but how does this translate to tasks humans actually care about? Real-world adaptability seems like the next hurdle.
45% benchmark boost sounds promising, but how replicable is this under different tasks? Hardware cost savings are good, but do they trade off against precision or adaptability in unstructured environments?
Sounds impressive, but without third-party validation, these numbers could be smoke and mirrors. Hardware savings matter, but stability and scalability in real environments will tell the real story.
Course aux modèles fondation embodied : X-Square, Xiaomi, GR00T