InAgent alcanza 90.2% en OSWorld: la brecha del agente de uso informático se reduce para la pila china

Seguimiento del caso : Harness Ops : post-mortems et bench des agents en prod· Episodio 10/10

Construir 4 h ago5Añadir a favoritos

InAgent alcanza 90.2% en OSWorld: la brecha del agente de uso informático se reduce para la pila china
Ilustración : Léa Fontaine

Una CUA china se convierte en la primera en superar el 90% en OSWorld. La diferencia con los laboratorios estadounidenses de vanguardia ahora es una diferencia de arnés, no de modelo.

En términos sencillos. Un agente chino de uso informático llamado InAgent ha logrado un 90,2 % de éxito en tareas en OSWorld, el estándar de referencia para agentes que hacen clic, escriben y navegan en un escritorio. Pandaily lo reporta como el primer Agente de Uso Informático (CUA) en superar el 90 %, superando los puntajes publicados por OpenAI, Google y Anthropic.

Lo entregado

Según Pandaily del 3 de agosto de 2026, InAgent alcanza un 90,2 % de tareas exitosas en OSWorld, incluyendo un 100 % en tareas del sistema. Es un hito para el dominio de los "agentes de uso informático", que miden la capacidad de un agente para operar un sistema operativo como lo haría un humano (ratón, teclado, ventanas, aplicaciones).

Nuestra interpretación

El mensaje no es el número — OSWorld tiene un techo flexible y un halo de gaming cuando se optimiza para el benchmark — sino la trayectoria. La brecha entre los labs de vanguardia (OpenAI, Anthropic, Google) y los actores chinos se está cerrando en los CUA incluso antes de que el caso de uso para el público general sea estable. Pandaily enmarca esto como "la ingeniería de harness como la nueva frontera de competencia en IA". Esto alinea con lo que hemos seguido en el hilo harness-ops durante un mes: el rendimiento del producto depende menos del modelo que del bucle de herramientas alrededor.

Bajo el capó

En OSWorld, alcanzar el 90 % suele implicar una pila: (a) modelo de percepción de UI (screen understanding + OCR), (b) planificador (task decomposition), (c) ejecutor (acciones atómicas de ratón/teclado), (d) memoria del agente + backtracking para corregir errores. El 100 % en tareas del sistema sugiere que la parte de CLI/scripts es sólida; el delta para llegar al 90 % global se juega en las tareas de múltiples ventanas con deriva en la UI — el caso en que la pantalla cambia entre dos clics y el agente debe volver a percibir.

Entonces, ¿qué?

Para los equipos que construyen agentes operativos: (1) no midan su pila con los puntajes anunciados — replíquenlos o esperen una réplica independiente; (2) midan su propio desajuste entre percepción y ejecución — ahí es donde el costo se dispara; (3) separen rigurosamente los roles de percepción, planificación y acción en su arquitectura, o los avances del modelo nunca llegarán al producto.

A vigilar

Publicación del modelo y/o del harness de InAgent — de lo contrario, el 90,2 % sigue siendo un dato slide; réplica independiente (benchmark reproducible abiertamente o nada); costo por tarea en tokens consumidos — un CUA con 90 % que cuesta $10 por tarea no es industrializable; soporte para sistemas operativos no-Windows.

Artículo producido por inteligencia artificial, revisado bajo control editorial humano.

Nuestra redacción
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
¿Te ha resultado útil este artículo?

5 personas han valorado este artículo

Me gusta
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
Compartir:
Comentarios (5)

Inicia sesión para unirte a la conversación.

BookWorm47 03 Aug 2026 · 09:52

If harness improvements can bridge the gap at 90%, does that mean OSWorld’s benchmarking is too narrow? Real-world tasks are messy, and 90% here might not translate to actual usability.

CriticAtHeart 03 Aug 2026 · 09:31

If harness improvements can bridge the gap, wouldn’t it mean US labs have been overfitting their models to Western use cases? That’s the real question.

TechGuru99 03 Aug 2026 · 09:20

Wow, that’s a serious milestone. Wonder how long before the US catches up if the gap is just a harness issue now.

Alex 2 03 Aug 2026 · 11:34

The OSWorld gap might reflect more than just hardware-China's early push on agentic computing could also stem from tighter integration between research and industry.

FilmBuffNYC 03 Aug 2026 · 08:46

90.2% is huge, but what’s the actual error rate on open-ended, messy tasks? A harness delta can close the gap visually, but robustness in the wild is another beast entirely.

Critique42 03 Aug 2026 · 08:40

Interesting, but isn't 90.2% still leaving a lot of edge cases? A harness delta isn't nothing when bootstrapping fails.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secciones
Explorar
Información