Handwerk Jul 13, 2026 at 02:197Zu Lesezeichen hinzufügen

Der Harness spricht vor dem Prompt. Was er sagt - und was er kostet - definiert nun das Produkt.
Ein Benchmark von Systima.ai (12. Juli 2026) hat gemessen, was Claude Code und OpenCode vor der Verarbeitung des Benutzerprompts senden: ~33.000 Tokens bei Claude Code, ~7.000 bei OpenCode. Der Unterschied ist nicht kosmetisch - er ist architektonisch.
Systima hat die API zwischen der CLI und dem Modell abgefangen: Claude Code sendet einen System-Prompt + eine Werkzeugbeschreibung + eine Nutzungsanweisung, die insgesamt ~33k Tokens umfassen; OpenCode sendet ~7k Tokens für die gleiche Einrichtung. Bei einem durchschnittlichen Nutzungszyklus führt dies zu zusätzlichen Kosten für die Tokens und zu Druck auf den KV-Cache.
Zwei Philosophien stehen sich gegenüber, und sie sind nicht neutral.
Claude Code setzt auf ein schweres Harness: detaillierte Anweisungen für die Werkzeuge, eingebettete Beispiele, reicher Rollenkontext, explizite Schutzmaßnahmen. Die Wette: Ein langer System-Prompt reduziert die Verhaltensvarianz, verbessert die Regelbefolgung und spart Iterationen. Kosten: Jede Runde werden zusätzliche Eingabetokens verbraucht.
OpenCode setzt auf ein leichtes Harness: minimales Werkzeug, kurzes System, das Modell soll selbst schließen. Die Wette: Weniger vorgefertigte Anker, mehr Flexibilität, geringere Kosten. Kosten: Mehr Varianz, mehr Risiko von Verhaltensabweichungen, wenn die Aufgabe vom Happy Path abweicht.
Beim Preis: Bei ~$3/M Eingabetokens Claude, 33k Tokens pro Runde × N Runden der Konversation, sind das mehrere Cent pro Sitzung, die der Benutzer nie sieht. Beim KV-Cache: Claude Code nutzt das Prompt-Caching von Anthropic - das Präfix wird zwischengespeichert und nach der ersten Verwendung nur noch zu ~10 % berechnet. Das ist der wahre wirtschaftliche Hebel. OpenCode, das kürzer ist, speichert nicht viel.
Der faire Vergleich ist nicht die Roh-Tokens, sondern die effektiv berechneten Tokens (mit Cache) × Ausgabequalität × Anzahl der Retries. Systima misst nur einen der drei Faktoren. Der tatsächliche Unterschied in der Berechnung liegt wahrscheinlich näher an 2× als an 5×, bleibt aber signifikant.
Das Harness wird zu einem Produktdifferenzierer. Zwei CLI-Agenten zu vergleichen, bedeutet, zwei Thesen darüber zu vergleichen, was das Modell vor dem Lesen des Benutzers wissen muss. Für einen Builder: Messen Sie Ihre eigene Präambel und ihre effektiven Kosten mit Cache. Für einen Leiter: Die wahrgenommene Latenz und die monatliche Rechnung hängen von einer architektonischen Wahl ab, die niemand in der kommerziellen Demo erwähnt.
Die Veröffentlichung eines "Harness Reference" durch Anthropic oder OpenAI; das Auftreten von Tools, die den tatsächlichen Overhead pro CLI messen; das Erscheinen offizieller "Diet"-Modi bei Claude Code oder Cursor.
Artikel von künstlicher Intelligenz erstellt, unter menschlicher redaktioneller Kontrolle geprüft.
Melden Sie sich an, um an der Diskussion teilzunehmen.
Est-ce que ces 33k tokens en plus améliorent vraiment la précision ? Ou c'est juste un surcoût ?
Comment ça impacte le budget des petites entreprises ?
Est-ce que cette surcharge va rendre les modèles moins adaptés aux gros projets ? Plus de tokens, ça veut dire plus de ressources nécessaires.
Avec 33k tokens, Claude Code consomme-t-il vraiment plus d'énergie qu'OpenCode ?
Est-ce que Claude Code est vraiment plus énergivore qu'OpenCode ?
Est-ce que ces différences de tokens impactent vraiment la réactivité des modèles en temps réel ?
Intéressant, mais comment ça se répercute sur l'usage concret ?
Comment ça impacte la performance et le prix final ?
Harness Ops : post-mortems et bench des agents en prod