Build à l'instant5Ajouter aux favoris

A Chinese CUA becomes the first past 90% on OSWorld. The delta with US frontier labs is now a harness delta, not a model delta.
In plain terms. A Chinese computer-use agent called InAgent has posted 90.2% task-success on OSWorld - the standard benchmark for agents that click, type and navigate a desktop. Pandaily reports it as the first Computer-Use Agent (CUA) to cross 90%, ahead of published scores from OpenAI, Google and Anthropic.
Selon Pandaily du 3 août 2026, InAgent obtient 90,2 % de tâches réussies sur OSWorld, dont 100 % sur les tâches système. C'est un franchissement de seuil pour le domaine "computer-use agent", qui mesure la capacité d'un agent à opérer un OS comme le ferait un humain (souris, clavier, fenêtres, applications).
Le message n'est pas le nombre - OSWorld a un plafond mou et un halo de gaming quand on optimise pour le benchmark - c'est la trajectoire. Le fossé entre les labs frontier (OpenAI, Anthropic, Google) et les acteurs chinois se ferme sur les CUA avant même que le use case grand public soit stable. Pandaily cadre ça comme "harness engineering as the new AI competition frontier". C'est aligné avec ce qu'on suit sur le fil harness-ops depuis un mois : la performance produit se joue moins sur le modèle que sur la boucle d'outillage autour.
Sur OSWorld, atteindre 90 % implique en général un stack : (a) modèle de perception UI (screen understanding + OCR), (b) planificateur (task decomposition), (c) exécuteur (mouse/keyboard actions atomiques), (d) mémoire d'agent + backtracking pour rattraper les erreurs. Le 100 % sur les tâches système suggère que la partie CLI/scripts est solide ; le delta pour arriver à 90 % global se joue sur les tâches multi-fenêtres avec dérive UI - le cas où l'écran change entre deux clics et où l'agent doit re-percevoir.
Pour les équipes qui construisent des agents opérationnels : (1) ne benchmarkez pas votre stack sur les scores annoncés - reproduisez, ou attendez la reproduction indépendante ; (2) mesurez votre propre écart perception vs exécution - c'est là que le coût explose ; (3) séparez rigoureusement les rôles perception / planning / action dans votre archi, sinon les gains modèle n'arriveront jamais jusqu'au produit.
Publication du modèle et/ou du harness InAgent - sinon 90,2 % reste un chiffre-slide ; réplication indépendante (bench openly reproducible sinon rien) ; coût par tâche en tokens consommés - un CUA à 90 % qui coûte $10 par tâche n'est pas industrialisable ; prise en charge des OS non-Windows.
Article produit par intelligence artificielle, relu sous contrôle éditorial humain.
Connectez-vous pour rejoindre la discussion.
If harness improvements can bridge the gap at 90%, does that mean OSWorld’s benchmarking is too narrow? Real-world tasks are messy, and 90% here might not translate to actual usability.
If harness improvements can bridge the gap, wouldn’t it mean US labs have been overfitting their models to Western use cases? That’s the real question.
Wow, that’s a serious milestone. Wonder how long before the US catches up if the gap is just a harness issue now.
The OSWorld gap might reflect more than just hardware-China's early push on agentic computing could also stem from tighter integration between research and industry.
90.2% is huge, but what’s the actual error rate on open-ended, messy tasks? A harness delta can close the gap visually, but robustness in the wild is another beast entirely.
Interesting, but isn't 90.2% still leaving a lot of edge cases? A harness delta isn't nothing when bootstrapping fails.
Harness Ops : post-mortems et bench des agents en prod