Artesanía Jul 13, 2026 at 02:197Añadir a favoritos

El arnés habla antes del prompt. Lo que dice —y cuánto cuesta— define ahora el producto.
Un benchmark de Systima.ai (12 de julio de 2026) midió lo que Claude Code y OpenCode envían antes de procesar el prompt del usuario: ~33 000 tokens en el caso de Claude Code, ~7 000 en el de OpenCode. La diferencia no es cosmética: es arquitectónica.
Systima interceptó la API entre el CLI y el modelo: Claude Code envía un system prompt + una descripción de herramientas + un recordatorio de uso que suman ~33k tokens; OpenCode envía ~7k tokens para la misma configuración. En un ciclo de uso promedio, esto se traduce en un sobrecoste de tokens facturados y en mayor presión sobre la caché KV.
Dos filosofías chocan, y no son neutrales.
Claude Code apuesta por un harness pesado: instrucciones detalladas para las herramientas, ejemplos integrados, contexto de rol rico, salvaguardas explícitas. La apuesta: un system prompt largo reduce la varianza de comportamiento, mejora la obediencia a las reglas y ahorra iteraciones. Coste: tokens de entrada inflados en cada turno.
OpenCode opta por un harness ligero: herramientas mínimas, sistema breve, dejando que el modelo infiera. La apuesta: menos anclas prefabricadas, más flexibilidad, menor factura. Coste: más varianza, mayor riesgo de desviaciones cuando la tarea se aleja del happy path.
En precio: a ~$3/M tokens de entrada en Claude, 33k tokens por turno × N turnos de conversación, son varios céntimos por sesión que el usuario nunca ve. En la caché KV: Claude Code aprovecha el prompt caching de Anthropic: el prefijo se cachea y se factura ~10 % después de la primera vez. Ese es el verdadero motor económico. OpenCode, más breve, no cachea gran cosa.
La comparación "justa" no es token bruto, sino token facturado efectivo (con caché) × calidad de salida × número de reintentos. Systima solo mide uno de los tres. La diferencia real en facturación probablemente ronda 2× en lugar de 5×, pero sigue siendo significativa.
El harness se convierte en un diferenciador de producto. Comparar dos CLI de agente es comparar dos tesis sobre qué debe saber el modelo antes de leer al usuario. Para un builder: mida su propio preámbulo y su coste efectivo con caché. Para un directivo: la latencia percibida y la factura mensual dependen de una elección arquitectónica que nadie menciona en la demo comercial.
La publicación por parte de Anthropic u OpenAI de un "harness reference"; la aparición de herramientas que midan la sobrecarga real por CLI; la introducción de modos "diet" oficiales en Claude Code o Cursor.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
Est-ce que ces 33k tokens en plus améliorent vraiment la précision ? Ou c'est juste un surcoût ?
Comment ça impacte le budget des petites entreprises ?
Est-ce que cette surcharge va rendre les modèles moins adaptés aux gros projets ? Plus de tokens, ça veut dire plus de ressources nécessaires.
Avec 33k tokens, Claude Code consomme-t-il vraiment plus d'énergie qu'OpenCode ?
Est-ce que Claude Code est vraiment plus énergivore qu'OpenCode ?
Est-ce que ces différences de tokens impactent vraiment la réactivité des modèles en temps réel ?
Intéressant, mais comment ça se répercute sur l'usage concret ?
Comment ça impacte la performance et le prix final ?
Harness Ops : post-mortems et bench des agents en prod