Строительство 3 h ago5В закладки

Китайская CUA обгоняет США на 90% в OSWorld. Разрыв с ведущими американскими лабораториями теперь определяется не моделью, а возможностями harness.
Простыми словами. Китайский агент для работы с компьютером InAgent показал 90,2% успешного выполнения задач на OSWorld — стандартном бенчмарке для агентов, которые кликают, печатают и управляют рабочим столом. Pandaily сообщает, что это первый компьютерный агент (CUA), преодолевший планку в 90%, опередив опубликованные результаты OpenAI, Google и Anthropic.
Согласно Pandaily от 3 августа 2026 года, InAgent достигает 90,2% успешного выполнения задач на OSWorld, включая 100% на системных задачах. Это важный рубеж для области "computer-use agent", которая оценивает способность агента работать с ОС так, как это делал бы человек (мышь, клавиатура, окна, приложения).
Важен не сам показатель — у OSWorld есть мягкий потолок и элемент гейминга при оптимизации под бенчмарк, — а траектория. Разрыв между ведущими лабораториями (OpenAI, Anthropic, Google) и китайскими игроками сокращается в области CUA ещё до того, как use case массового потребителя станет стабильным. Pandaily называет это "инженерия harness как новый фронт конкуренции в ИИ". Это согласуется с тем, что мы наблюдаем на нитке harness-ops на протяжении месяца: производительность продукта зависит не столько от модели, сколько от инструментального цикла вокруг неё.
На OSWorld достижение 90% обычно требует стека: (a) модель восприятия UI (понимание экрана + OCR), (b) планировщик (декомпозиция задач), (c) исполнитель (атомарные действия мыши/клавиатуры), (d) память агента + откат для исправления ошибок. 100% на системных задачах говорит о том, что часть с CLI/скриптами надёжна; разрыв до 90% в целом возникает на мног оконных задачах с изменением UI — когда экран меняется между двумя кликами, и агенту приходится воспринимать его заново.
Для команд, строящих операционные агенты: (1) не зацикливайтесь на объявленных бенчмарках — воспроизводите их или ждите независимого воспроизведения; (2) измеряйте собственный разрыв между восприятием и исполнением — именно здесь стоимость взрывается; (3) строго разделяйте роли восприятия, планирования и действия в архитектуре, иначе преимущества модели так и не дойдут до продукта.
Публикация модели и/или harness InAgent — иначе 90,2% останется цифрой ради цифры; независимая репликация (бенчмарк должен быть openly reproducible, иначе это ничего не стоит); стоимость за задачу в потреблённых токенах — CUA с 90%, который стоит $10 за задачу, не подлежит индустриализации; поддержка ОС, не основанных на Windows.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
If harness improvements can bridge the gap at 90%, does that mean OSWorld’s benchmarking is too narrow? Real-world tasks are messy, and 90% here might not translate to actual usability.
If harness improvements can bridge the gap, wouldn’t it mean US labs have been overfitting their models to Western use cases? That’s the real question.
Wow, that’s a serious milestone. Wonder how long before the US catches up if the gap is just a harness issue now.
The OSWorld gap might reflect more than just hardware-China's early push on agentic computing could also stem from tighter integration between research and industry.
90.2% is huge, but what’s the actual error rate on open-ended, messy tasks? A harness delta can close the gap visually, but robustness in the wild is another beast entirely.
Interesting, but isn't 90.2% still leaving a lot of edge cases? A harness delta isn't nothing when bootstrapping fails.
Harness Ops : post-mortems et bench des agents en prod