InAgent достигает 90,2% на OSWorld: разрыв в использовании компьютерных агентов сокращается для китайского стека

Продолжение истории : Harness Ops : post-mortems et bench des agents en prod· Часть 10/10

Строительство 3 h ago5В закладки

InAgent достигает 90,2% на OSWorld: разрыв в использовании компьютерных агентов сокращается для китайского стека
Иллюстрация : Léa Fontaine

Китайская CUA обгоняет США на 90% в OSWorld. Разрыв с ведущими американскими лабораториями теперь определяется не моделью, а возможностями harness.

Простыми словами. Китайский агент для работы с компьютером InAgent показал 90,2% успешного выполнения задач на OSWorld — стандартном бенчмарке для агентов, которые кликают, печатают и управляют рабочим столом. Pandaily сообщает, что это первый компьютерный агент (CUA), преодолевший планку в 90%, опередив опубликованные результаты OpenAI, Google и Anthropic.

Что было представлено

Согласно Pandaily от 3 августа 2026 года, InAgent достигает 90,2% успешного выполнения задач на OSWorld, включая 100% на системных задачах. Это важный рубеж для области "computer-use agent", которая оценивает способность агента работать с ОС так, как это делал бы человек (мышь, клавиатура, окна, приложения).

Наше понимание

Важен не сам показатель — у OSWorld есть мягкий потолок и элемент гейминга при оптимизации под бенчмарк, — а траектория. Разрыв между ведущими лабораториями (OpenAI, Anthropic, Google) и китайскими игроками сокращается в области CUA ещё до того, как use case массового потребителя станет стабильным. Pandaily называет это "инженерия harness как новый фронт конкуренции в ИИ". Это согласуется с тем, что мы наблюдаем на нитке harness-ops на протяжении месяца: производительность продукта зависит не столько от модели, сколько от инструментального цикла вокруг неё.

Под капотом

На OSWorld достижение 90% обычно требует стека: (a) модель восприятия UI (понимание экрана + OCR), (b) планировщик (декомпозиция задач), (c) исполнитель (атомарные действия мыши/клавиатуры), (d) память агента + откат для исправления ошибок. 100% на системных задачах говорит о том, что часть с CLI/скриптами надёжна; разрыв до 90% в целом возникает на мног оконных задачах с изменением UI — когда экран меняется между двумя кликами, и агенту приходится воспринимать его заново.

Что это значит

Для команд, строящих операционные агенты: (1) не зацикливайтесь на объявленных бенчмарках — воспроизводите их или ждите независимого воспроизведения; (2) измеряйте собственный разрыв между восприятием и исполнением — именно здесь стоимость взрывается; (3) строго разделяйте роли восприятия, планирования и действия в архитектуре, иначе преимущества модели так и не дойдут до продукта.

На что обратить внимание

Публикация модели и/или harness InAgent — иначе 90,2% останется цифрой ради цифры; независимая репликация (бенчмарк должен быть openly reproducible, иначе это ничего не стоит); стоимость за задачу в потреблённых токенах — CUA с 90%, который стоит $10 за задачу, не подлежит индустриализации; поддержка ОС, не основанных на Windows.

Статья создана искусственным интеллектом и проверена под редакционным контролем человека.

Наша редакция
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Была ли статья полезной?

5 чел. оценили эту статью

Нравится
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
Поделиться:
Комментарии (5)

Войдите, чтобы участвовать в обсуждении.

BookWorm47 03 Aug 2026 · 09:52

If harness improvements can bridge the gap at 90%, does that mean OSWorld’s benchmarking is too narrow? Real-world tasks are messy, and 90% here might not translate to actual usability.

CriticAtHeart 03 Aug 2026 · 09:31

If harness improvements can bridge the gap, wouldn’t it mean US labs have been overfitting their models to Western use cases? That’s the real question.

TechGuru99 03 Aug 2026 · 09:20

Wow, that’s a serious milestone. Wonder how long before the US catches up if the gap is just a harness issue now.

Alex 2 03 Aug 2026 · 11:34

The OSWorld gap might reflect more than just hardware-China's early push on agentic computing could also stem from tighter integration between research and industry.

FilmBuffNYC 03 Aug 2026 · 08:46

90.2% is huge, but what’s the actual error rate on open-ended, messy tasks? A harness delta can close the gap visually, but robustness in the wild is another beast entirely.

Critique42 03 Aug 2026 · 08:40

Interesting, but isn't 90.2% still leaving a lot of edge cases? A harness delta isn't nothing when bootstrapping fails.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Темы
Обзор
Информация