InAgent가 OSWorld에서 90.2% 달성: 컴퓨터 사용 에이전트 격차가 중국 스택에서 좁혀지다

진행 중인 이슈 : Harness Ops : post-mortems et bench des agents en prod· 편 10/10

빌드 3 h ago5북마크에 추가

InAgent가 OSWorld에서 90.2% 달성: 컴퓨터 사용 에이전트 격차가 중국 스택에서 좁혀지다
삽화 : Léa Fontaine

중국 CUA가 OSWorld에서 처음으로 90%를 돌파했습니다. 이제 미국 선도 연구소와의 격차는 모델 격차가 아니라 하네스 격차입니다.

간단히 말해 중국 컴퓨터 사용 에이전트 InAgent가 OSWorld(클릭, 타이핑, 데스크톱 탐색 에이전트의 표준 벤치마크)에서 90.2%의 작업 성공률을 기록했다. 판데일리(Pandaily)는 이를 오픈AI, 구글, 앤트로픽의 공개 점수를 앞지르며 90%를 돌파한 최초의 컴퓨터 사용 에이전트(CUA)로 보도했다.

제공된 내용

2026년 8월 3일 판데일리 보도에 따르면 InAgent는 OSWorld에서 90.2%의 작업 성공률을 기록했으며, 시스템 작업에서는 100%를 달성했다. 이는 에이전트가 인간처럼 OS를 조작(마우스, 키보드, 윈도우, 애플리케이션)할 수 있는 능력을 측정하는 '컴퓨터 사용 에이전트' 분야에서 큰 도약이다.

우리의 해석

중요한 건 숫자가 아니다. OSWorld는 벤치마크 최적화 시 '하드 캡'과 게이밍 효과가 있기 때문이다. 중요한 건 추세다. 최전선 연구실(오픈AI, 앤트로픽, 구글)과 중국 기업 간의 격차가 컴퓨터 사용 에이전트 분야에서 아직 대중 시장이 안정화되기도 전에 좁혀지고 있다는 점이다. 판데일리는 이를 "하네스 엔지니어링이 새로운 AI 경쟁 전선"으로 묘사했다. 이는 지난 한 달간 하네스-옵스(harnes-ops) 분야를 추적한 우리의 관점과도 일치한다: 제품 성능은 모델 자체보다 주변 도구 루프에 좌우된다.

내부 구조

OSWorld에서 90%를 달성하려면 일반적으로 다음과 같은 스택이 필요하다: (a) UI 인식 모델(화면 이해 + OCR), (b) 계획자(작업 분해), (c) 실행기(원자적 마우스/키보드 조작), (d) 에이전트 메모리 + 오류 복구를 위한 백트래킹. 시스템 작업 100% 달성은 CLI/스크립트 부분이 견고하다는 뜻이며, 나머지 90%까지의 차이는 다중 윈도우 및 UI 변화(두 번의 클릭 사이에 화면이 바뀌어 에이전트가 재인식해야 하는 경우)에서 발생한다.

결론

운영 에이전트를 구축하는 팀에게: (1) 공개된 점수에 의존하지 말고 자체 재현하거나 독립적인 재현을 기다려라; (2) 인식과 실행의 격차를 측정하라—비용이 폭발하는 지점이다; (3) 인식/계획/액션 역할을 엄격히 분리하라. 그렇지 않으면 모델 성능이 제품으로 이어지지 않을 것이다.

주시할 점

InAgent의 모델 및/또는 하네스 공개—그렇지 않으면 90.2%는 슬라이드 수치에 불과하다; 독립적인 재현(공개적으로 재현 가능한 벤치마크가 아니면 의미 없다); 토큰 소비 기준 작업당 비용—90% 성공률의 에이전트가 작업당 $10가 든다면 산업화할 수 없다; 윈도우가 아닌 OS 지원.

인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.

편집팀
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
이 기사가 도움이 되었나요?

5 명이 이 기사를 좋아합니다

좋아요
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
공유:
댓글 (5)

토론에 참여하려면 로그인하세요.

BookWorm47 03 Aug 2026 · 09:52

If harness improvements can bridge the gap at 90%, does that mean OSWorld’s benchmarking is too narrow? Real-world tasks are messy, and 90% here might not translate to actual usability.

CriticAtHeart 03 Aug 2026 · 09:31

If harness improvements can bridge the gap, wouldn’t it mean US labs have been overfitting their models to Western use cases? That’s the real question.

TechGuru99 03 Aug 2026 · 09:20

Wow, that’s a serious milestone. Wonder how long before the US catches up if the gap is just a harness issue now.

Alex 2 03 Aug 2026 · 11:34

The OSWorld gap might reflect more than just hardware-China's early push on agentic computing could also stem from tighter integration between research and industry.

FilmBuffNYC 03 Aug 2026 · 08:46

90.2% is huge, but what’s the actual error rate on open-ended, messy tasks? A harness delta can close the gap visually, but robustness in the wild is another beast entirely.

Critique42 03 Aug 2026 · 08:40

Interesting, but isn't 90.2% still leaving a lot of edge cases? A harness delta isn't nothing when bootstrapping fails.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
토픽
탐색
정보