InAgentがOSWorldで90.2%を達成:コンピューター使用エージェントのギャップが中国スタックで縮小

継続中のトピック : Harness Ops : post-mortems et bench des agents en prod· パート 10/10

ビルド 3 h ago5ブックマークに追加

InAgentがOSWorldで90.2%を達成:コンピューター使用エージェントのギャップが中国スタックで縮小
イラスト : Léa Fontaine

中国のCUAがOSWorldで初めて90%を突破。米国のフロンティア研究所との差は、モデルの差ではなく、ハーネスの差となった。

簡単に言えば。中国のコンピューター使用エージェント「InAgent」が、デスクトップのクリック、入力、ナビゲーションを行うエージェントの標準ベンチマーク「OSWorld」で90.2%のタスク成功率を達成した。Pandailyはこれを、OpenAI、Google、Anthropicの公開スコアを上回る、90%を超えた初の「Computer-Use Agent(CUA)」と報じている。

提供された内容

2026年8月3日のPandailyによると、InAgentはOSWorldで90.2%のタスク成功率を達成し、そのうちシステムタスクでは100%を記録した。これは、人間のようにOSを操作するエージェント(マウス、キーボード、ウィンドウ、アプリケーション)の能力を測る「computer-use agent」分野における画期的な成果だ。

私たちの解釈

重要なのは数字ではなく、その軌跡だ。OSWorldはベンチマーク最適化の際に「ソフトキャップ」と「ゲーム的なハロー効果」を持つが、フロンティア研究機関(OpenAI、Anthropic、Google)と中国勢のCUA分野におけるギャップは、一般ユースケースが安定する前にすでに縮まりつつある。Pandailyはこれを「新たなAI競争のフロンティアとしてのハーネスエンジニアリング」と位置付けている。これは、過去1ヶ月にわたりハーネス・オプスの動向を追ってきた我々の見解とも一致する:製品のパフォーマンスはモデルよりも、その周辺のツールループにかかっている。

内部構造

OSWorldで90%を達成するには、一般的に以下のスタックが必要だ: (a) UI認識モデル(画面理解 + OCR) (b) プランナー(タスク分解) (c) エグゼキューター(マウス/キーボードの原子的アクション) (d) エージェントメモリ + バックトラッキング(エラー回復) システムタスクでの100%達成は、CLI/スクリプト部分が堅牢であることを示唆しており、90%到達までの差は、UIが変化するマルチウィンドウタスク(画面が2回のクリック間で変化し、エージェントが再認識する必要があるケース)で生じている。

結論

実用的なエージェントを開発するチームへの提言:

  1. ベンチマークスコアに基づいてスタックを評価するのではなく、再現実験を行うか、独立した再現を待つこと
  2. 知覚と実行のギャップを測定せよ — これがコストの爆発的増加につながる
  3. アーキテクチャで知覚・プランニング・アクションの役割を厳密に分離せよ。さもなければ、モデルの向上は製品に反映されない

要注目ポイント

  • InAgentのモデルおよび/またはハーネスの公開(そうでなければ90.2%は単なる数字に過ぎない)
  • 独立した再現実験(ベンチマークが公開・再現可能でなければ無意味)
  • タスクあたりのコスト(トークン消費量) — 90%を達成しても1タスクあたり$10かかるCUAは実用化できない
  • Windows以外のOSへの対応

本記事は人工知能により作成され、人間の編集管理のもとで校閲されています。

編集部について
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
この記事は役に立ちましたか?

5 人がこの記事を評価しました

いいね
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
シェア:
コメント (5)

ログインして議論に参加しましょう。

BookWorm47 03 Aug 2026 · 09:52

If harness improvements can bridge the gap at 90%, does that mean OSWorld’s benchmarking is too narrow? Real-world tasks are messy, and 90% here might not translate to actual usability.

CriticAtHeart 03 Aug 2026 · 09:31

If harness improvements can bridge the gap, wouldn’t it mean US labs have been overfitting their models to Western use cases? That’s the real question.

TechGuru99 03 Aug 2026 · 09:20

Wow, that’s a serious milestone. Wonder how long before the US catches up if the gap is just a harness issue now.

Alex 2 03 Aug 2026 · 11:34

The OSWorld gap might reflect more than just hardware-China's early push on agentic computing could also stem from tighter integration between research and industry.

FilmBuffNYC 03 Aug 2026 · 08:46

90.2% is huge, but what’s the actual error rate on open-ended, messy tasks? A harness delta can close the gap visually, but robustness in the wild is another beast entirely.

Critique42 03 Aug 2026 · 08:40

Interesting, but isn't 90.2% still leaving a lot of edge cases? A harness delta isn't nothing when bootstrapping fails.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
テーマ
探索
インフォメーション