InAgent hits 90.2% on OSWorld: the computer-use agent gap narrows for the Chinese stack

Suivi de l'affaire : Harness Ops : post-mortems et bench des agents en prod· Épisode 10/10

Build à l'instant5Ajouter aux favoris

InAgent hits 90.2% on OSWorld: the computer-use agent gap narrows for the Chinese stack
Illustration : Léa Fontaine

A Chinese CUA becomes the first past 90% on OSWorld. The delta with US frontier labs is now a harness delta, not a model delta.

In plain terms. A Chinese computer-use agent called InAgent has posted 90.2% task-success on OSWorld - the standard benchmark for agents that click, type and navigate a desktop. Pandaily reports it as the first Computer-Use Agent (CUA) to cross 90%, ahead of published scores from OpenAI, Google and Anthropic.

Ce qui a été livré

Selon Pandaily du 3 août 2026, InAgent obtient 90,2 % de tâches réussies sur OSWorld, dont 100 % sur les tâches système. C'est un franchissement de seuil pour le domaine "computer-use agent", qui mesure la capacité d'un agent à opérer un OS comme le ferait un humain (souris, clavier, fenêtres, applications).

Notre lecture

Le message n'est pas le nombre - OSWorld a un plafond mou et un halo de gaming quand on optimise pour le benchmark - c'est la trajectoire. Le fossé entre les labs frontier (OpenAI, Anthropic, Google) et les acteurs chinois se ferme sur les CUA avant même que le use case grand public soit stable. Pandaily cadre ça comme "harness engineering as the new AI competition frontier". C'est aligné avec ce qu'on suit sur le fil harness-ops depuis un mois : la performance produit se joue moins sur le modèle que sur la boucle d'outillage autour.

Under the hood

Sur OSWorld, atteindre 90 % implique en général un stack : (a) modèle de perception UI (screen understanding + OCR), (b) planificateur (task decomposition), (c) exécuteur (mouse/keyboard actions atomiques), (d) mémoire d'agent + backtracking pour rattraper les erreurs. Le 100 % sur les tâches système suggère que la partie CLI/scripts est solide ; le delta pour arriver à 90 % global se joue sur les tâches multi-fenêtres avec dérive UI - le cas où l'écran change entre deux clics et où l'agent doit re-percevoir.

So what

Pour les équipes qui construisent des agents opérationnels : (1) ne benchmarkez pas votre stack sur les scores annoncés - reproduisez, ou attendez la reproduction indépendante ; (2) mesurez votre propre écart perception vs exécution - c'est là que le coût explose ; (3) séparez rigoureusement les rôles perception / planning / action dans votre archi, sinon les gains modèle n'arriveront jamais jusqu'au produit.

À surveiller

Publication du modèle et/ou du harness InAgent - sinon 90,2 % reste un chiffre-slide ; réplication indépendante (bench openly reproducible sinon rien) ; coût par tâche en tokens consommés - un CUA à 90 % qui coûte $10 par tâche n'est pas industrialisable ; prise en charge des OS non-Windows.

Article produit par intelligence artificielle, relu sous contrôle éditorial humain.

Notre rédaction
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Cet article vous a-t-il été utile ?

5 personnes ont aimé cet article

J'aime
A
Aiko NakamuraIngénieure logicielle senior
🇯🇵 Ingénieure senior, plateformes à grande échelle. Écrit sur la construction avec l'IA.
Partager :
Commentaires (5)

Connectez-vous pour rejoindre la discussion.

BookWorm47 03 Aug 2026 · 09:52

If harness improvements can bridge the gap at 90%, does that mean OSWorld’s benchmarking is too narrow? Real-world tasks are messy, and 90% here might not translate to actual usability.

CriticAtHeart 03 Aug 2026 · 09:31

If harness improvements can bridge the gap, wouldn’t it mean US labs have been overfitting their models to Western use cases? That’s the real question.

TechGuru99 03 Aug 2026 · 09:20

Wow, that’s a serious milestone. Wonder how long before the US catches up if the gap is just a harness issue now.

Alex 2 03 Aug 2026 · 11:34

The OSWorld gap might reflect more than just hardware-China's early push on agentic computing could also stem from tighter integration between research and industry.

FilmBuffNYC 03 Aug 2026 · 08:46

90.2% is huge, but what’s the actual error rate on open-ended, messy tasks? A harness delta can close the gap visually, but robustness in the wild is another beast entirely.

Critique42 03 Aug 2026 · 08:40

Interesting, but isn't 90.2% still leaving a lot of edge cases? A harness delta isn't nothing when bootstrapping fails.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Rubriques
Explorer
Informations