Criar Jul 13, 2026 at 02:197Adicionar aos favoritos

O harness fala antes do prompt. O que ele diz — e quanto custa — define agora o produto.
Um benchmark da Systima.ai (12 de julho de 2026) mediu o que Claude Code e OpenCode enviam antes de processar o prompt do usuário: ~33.000 tokens no lado do Claude Code, ~7.000 no lado do OpenCode. A diferença não é apenas cosmética — é arquitetural.
A Systima interceptou a API entre o CLI e o modelo: o Claude Code envia um system prompt + uma descrição de ferramentas + um lembrete de uso totalizando ~33k tokens; o OpenCode envia ~7k tokens para a mesma configuração. Em um ciclo médio de uso, isso se traduz em sobrecusto de tokens faturados e pressão no KV cache.
Duas filosofias se opõem, e não são neutras.
Claude Code adota uma abordagem de harness pesado: instruções detalhadas para as ferramentas, exemplos embarcados, contexto rico de papel, guardrails explícitos. A aposta: um system prompt longo reduz a variância de comportamento, melhora a obediência às regras e economiza iterações. Custo: tokens de entrada inflados a cada rodada.
OpenCode adota uma abordagem de harness leve: ferramentas mínimas, sistema curto, deixando o modelo inferir. A aposta: menos âncoras pré-fabricadas, mais flexibilidade, menor custo. Custo: mais variância, maior risco de desvio de comportamento quando a tarefa se afasta do happy path.
No preço: a ~$3/M tokens de entrada no Claude, 33k tokens por rodada × N rodadas de conversa, são vários centavos por sessão que o usuário nunca vê. No KV cache: o Claude Code explora o prompt caching da Anthropic — o prefixo é armazenado em cache e faturado a ~10% após a primeira vez. Esse é o verdadeiro alavancador econômico. O OpenCode, mais curto, não tem muito o que cachear.
O comparativo "justo" não é o de tokens brutos, mas tokens efetivamente faturados (com cache) × qualidade da saída × número de retries. A Systima mede apenas um dos três. A diferença real de faturamento provavelmente é mais próxima de 2× do que de 5×, mas ainda significativa.
O harness se torna um diferencial de produto. Comparar dois CLIs de agente é comparar duas teses sobre o que o modelo deve saber antes de ler o usuário. Para um desenvolvedor: meça seu próprio preâmbulo e seu custo efetivo com cache. Para um executivo: a latência percebida e a conta mensal dependem de uma escolha arquitetural que ninguém menciona na demo comercial.
A publicação pela Anthropic ou OpenAI de um "harness de referência"; o surgimento de ferramentas que medem a sobrecarga real por CLI; o aparecimento de modos "diet" oficiais no Claude Code ou Cursor.
Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.
Inicie sessão para se juntar à discussão.
Est-ce que ces 33k tokens en plus améliorent vraiment la précision ? Ou c'est juste un surcoût ?
Comment ça impacte le budget des petites entreprises ?
Est-ce que cette surcharge va rendre les modèles moins adaptés aux gros projets ? Plus de tokens, ça veut dire plus de ressources nécessaires.
Avec 33k tokens, Claude Code consomme-t-il vraiment plus d'énergie qu'OpenCode ?
Est-ce que Claude Code est vraiment plus énergivore qu'OpenCode ?
Est-ce que ces différences de tokens impactent vraiment la réactivité des modèles en temps réel ?
Intéressant, mais comment ça se répercute sur l'usage concret ?
Comment ça impacte la performance et le prix final ?
Harness Ops : post-mortems et bench des agents en prod