ホライゾン Aug 25, 2026 at 16:278ブックマークに追加

X Squareは特定のFigure AIのロボット操作タスクベンチマークを標的にし、それを45%上回ったと主張した。Wall-Bのソーティングがハードウェアコストを70%削減し、LimX DynamicsがFigureと同等の能力を達成、Tiangong Omniが作業タスクで満点を獲得する中、中国のヒューマノイド研究所はDeepSeekがGPT-4に対して行ったのと同様の「能力対コスト圧縮」を展開していることが構造的に明らかとなっている。
Figure AIはシリコンバレーで最も資金調達されたロボット企業の一つだ。X Squareは中国の競合企業で、Figure自身が公開したベンチマークを使用して自社のロボットをテストし、45%上回る成績を主張している。これは、中国のヒューマノイド研究所が西側の競合他社をコスト面で、そしてますますベンチマーク能力の面でも上回りつつあるというパターンの3回目または4回目のデータポイントだ。
X Squareのアプローチは、競合他社の公開ベンチマークを明確に狙った競争上のシグナルだ。つまり、「我々は彼らの数値を上回る自信があり、市場にそれを知らしめたい」ということだ。
Pandailyの報道によると、具体的な数字で検証可能な主張となっている。X Squareは1時間の編集なしで1,816個の荷物を並べ替えたという。目標とした1,248個は偶然にもFigure AIの持続的な1時間当たりの平均値と一致していた。これは1,816 / 1,248 = 45.6%に相当し、編集なしの一発撮りビデオでFigureのベンチマークを上回ったことになる。
この主張が典型的なベンチマーク主張よりも強力な理由は2つある。タスク(荷物の並べ替え)が具体的で測定可能なものであり、「編集なし」というフレーミングが、ヒューマノイドロボットのデモにしばしば向けられる編集への批判に対する直接的な応答となっている点だ。
DeepSeekはLLMで、焦点を絞ったエンジニアリングと効率的なトレーニングにより、10倍のコストをかける企業との能力格差を短期間で埋められることを示した。実体化された知能の類似点:X Square、LimX Dynamics、Unitree、Tiangongは、同じダイナミクスが物理的AIにも当てはまることを実証している。問題は、荷物並べ替えベンチマークだけでなく、実運用規模や実環境下でもこれが成り立つかどうかだ。
X Squareの主張は単独で現れたわけではない。同時期に以下の出来事があった。Tiangong Omniが標準的な作業タスクで満点を獲得(1.35m、39kg、フルタスクベンチマーク)。LimX DynamicsがFigureの能力に匹敵するロボットを大幅に低いハードウェアコストで実演。WRC 2026が中国の実体化知能エコシステムで300社以上の活発な企業を示した。
競争のループは、発表サイクルよりも速く回っている。
この種のベンチマーク圧力に対するFigureの対応は重要だ。選択肢としては:挑戦者が達成していないパフォーマンスを示す新たな結果を発表する、ベンチマークから実運用規模へと競争の枠組みをシフトする(偽装が難しく、商業的意義が高い)、ギャップが実際に存在する特定の能力においてロードマップを加速させる、などが挙げられる。
Figureにとって最悪のシナリオは、自ら設計したベンチマークではないレースに引き込まれ、挑戦者に有利な指標で競い合う一方で、実運用顧客が重視するものは全く異なるという状況だ。
中国と米国のヒューマノイド能力格差は、ベンチマーク上では急速に縮まっているが、実運用規模ではそうではない。市場ポジションにとって重要な指標は、デモでの荷物数ではなく、実環境下での実運用時間だ。Figureの今後6か月の実運用数が注目されるべき指標であり、ベンチマークスコアではない。
本記事は人工知能により作成され、人間の編集管理のもとで校閲されています。
45% faster benchmarks are one thing, but until we see these robots stacking a real dishwasher or assisting an elderly person, the real test remains unseen. Hardware savings matter, but safety and adaptability will decide if this tech ever leaves the lab.
45% faster benchmarks sound impressive, but how do they translate into consistent performance in dynamic kitchen environments where even a slight spill can throw off a whole sequence?
Hardware cost savings are great, but 45% faster benchmarks won't mean much if the robots can't handle messy real-world tasks like tying shoes or handling wet towels.
This is huge! If true, this could really shake up the humanoid robotics space. But I still wonder about real-world performance outside of benchmarks.
The benchmark race is getting wild, but I’m more curious about long-term robustness than raw percentages. Can these gains hold up after months of real-world use?
45% faster benchmarks are impressive, but how does this translate to tasks humans actually care about? Real-world adaptability seems like the next hurdle.
45% benchmark boost sounds promising, but how replicable is this under different tasks? Hardware cost savings are good, but do they trade off against precision or adaptability in unstructured environments?
Sounds impressive, but without third-party validation, these numbers could be smoke and mirrors. Hardware savings matter, but stability and scalability in real environments will tell the real story.
Course aux modèles fondation embodied : X-Square, Xiaomi, GR00T