InAgent atinge 90,2% no OSWorld: a lacuna do agente de uso de computador diminui para a pilha chinesa

Seguimento do caso : Harness Ops : post-mortems et bench des agents en prod· Episódio 10/10

Construir 4 h ago5Adicionar aos favoritos

InAgent atinge 90,2% no OSWorld: a lacuna do agente de uso de computador diminui para a pilha chinesa
Ilustração : Léa Fontaine

Uma CUA chinesa torna-se o primeiro a ultrapassar 90% no OSWorld. A diferença em relação aos laboratórios de fronteira dos EUA agora é uma diferença de *harness*, não uma diferença de modelo.

Em termos simples. Um agente chinês de uso de computador chamado InAgent obteve 90,2% de sucesso em tarefas no OSWorld — o padrão de referência para agentes que clicam, digitam e navegam em um desktop. A Pandaily relata que é o primeiro Agente de Uso de Computador (CUA) a ultrapassar 90%, superando os resultados publicados pela OpenAI, Google e Anthropic.

O que foi entregue

Segundo a Pandaily de 3 de agosto de 2026, o InAgent atinge 90,2% de tarefas bem-sucedidas no OSWorld, incluindo 100% nas tarefas do sistema. É um marco para o domínio de "agentes de uso de computador", que mede a capacidade de um agente operar um sistema operacional como um humano (mouse, teclado, janelas, aplicativos).

Nossa análise

A notícia não é o número — o OSWorld tem um teto flexível e um viés de "gaming" quando se otimiza para o benchmark — mas a trajetória. A lacuna entre os laboratórios de ponta (OpenAI, Anthropic, Google) e os atores chineses está se fechando nos CUAs antes mesmo que o caso de uso para o público geral se estabilize. A Pandaily enquadra isso como "engenharia de harness como a nova fronteira de competição em IA". Isso está alinhado com o que acompanhamos na thread harness-ops há um mês: o desempenho do produto depende menos do modelo e mais do loop de ferramentas ao redor.

Por baixo do capô

No OSWorld, atingir 90% geralmente envolve uma stack: (a) modelo de percepção de UI (entendimento de tela + OCR), (b) planejador (decomposição de tarefas), (c) executor (ações atômicas de mouse/teclado), (d) memória do agente + backtracking para corrigir erros. Os 100% em tarefas do sistema sugerem que a parte de CLI/scripts é sólida; a diferença para chegar aos 90% globais está nas tarefas multi-janelas com deriva de UI — casos em que a tela muda entre dois cliques e o agente precisa re-perceber.

E daí?

Para equipes que constroem agentes operacionais: (1) não meçam sua stack apenas pelos scores anunciados — repliquem ou aguardem reprodução independente; (2) meçam seu próprio gap entre percepção e execução — é aí que o custo explode; (3) separem rigidamente os papéis de percepção, planejamento e ação em sua arquitetura, ou os ganhos do modelo nunca chegarão ao produto.

O que acompanhar

  • Publicação do modelo e/ou do harness do InAgent — caso contrário, 90,2% é apenas um número;
  • Replicação independente (benchmarks abertamente reproduzíveis ou nada feito);
  • Custo por tarefa em tokens consumidos — um CUA com 90% que custa $10 por tarefa não é industrializável;
  • Suporte a sistemas operacionais além do Windows.

Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.

A nossa redação
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Este artigo foi-lhe útil?

5 pessoas gostaram deste artigo

Gosto
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
Partilhar:
Comentários (5)

Inicie sessão para se juntar à discussão.

BookWorm47 03 Aug 2026 · 09:52

If harness improvements can bridge the gap at 90%, does that mean OSWorld’s benchmarking is too narrow? Real-world tasks are messy, and 90% here might not translate to actual usability.

CriticAtHeart 03 Aug 2026 · 09:31

If harness improvements can bridge the gap, wouldn’t it mean US labs have been overfitting their models to Western use cases? That’s the real question.

TechGuru99 03 Aug 2026 · 09:20

Wow, that’s a serious milestone. Wonder how long before the US catches up if the gap is just a harness issue now.

Alex 2 03 Aug 2026 · 11:34

The OSWorld gap might reflect more than just hardware-China's early push on agentic computing could also stem from tighter integration between research and industry.

FilmBuffNYC 03 Aug 2026 · 08:46

90.2% is huge, but what’s the actual error rate on open-ended, messy tasks? A harness delta can close the gap visually, but robustness in the wild is another beast entirely.

Critique42 03 Aug 2026 · 08:40

Interesting, but isn't 90.2% still leaving a lot of edge cases? A harness delta isn't nothing when bootstrapping fails.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secções
Explorar
Informações