クラフト Jul 13, 2026 at 02:197ブックマークに追加

ハーネスがプロンプトの前に話します。彼が言うこと、そしてそのコストが、今や製品を定義します。
Systima.ai (2026年7月12日) のベンチマークによると、Claude Code と OpenCode がユーザープロンプトを処理する前に送信する内容は、Claude Code が約33,000トークン、OpenCode が約7,000トークンであった。この差は単なる見た目の違いではなく、アーキテクチャの違いに由来する。
Systima は CLI とモデル間の API を傍受した。Claude Code は system prompt + ツールの説明 + 使用方法のリマインダーを合わせて約33,000トークン送信するのに対し、OpenCode は同じセットアップで約7,000トークンしか送信しない。平均的な使用サイクルでは、これは課金されるトークンの増加と KV キャッシュへの負荷につながる。
二つの哲学が対立しており、どちらも中立ではない。
Claude Code は「重いハーネス」を採用:詳細なツールの指示、埋め込み例、リッチなロールコンテキスト、明示的なガードレール。賭けは:長い system prompt により振る舞いのばらつきを減らし、ルールへの従順性を向上させ、反復を節約する。コスト:各ターンで入力トークンが増加。
OpenCode は「軽いハーネス」を採用:最小限のツール、短い system prompt、モデルに推論させる。賭けは:事前に用意されたアンカーを減らし、柔軟性を高め、コストを抑える。コスト:ばらつきの増加、タスクが happy path から外れた際の振る舞いのずれのリスク。
価格面では:Claude の入力トークンが約$3/M であることを考慮すると、33,000トークン×N回の会話で、ユーザーが気づかない数セントが各セッションで発生する。KV キャッシュ面では:Claude Code は Anthropic の prompt caching を活用しており、プレフィックスは最初の一度だけキャッシュされ、その後は約10%のコストで再利用される。これが本当の経済的メリットだ。OpenCode はより短いため、ほとんどキャッシュされない。
公平な比較は、生のトークン数ではなく、「実効課金トークン(キャッシュ込み)」× 出力品質 × リトライ回数で行われるべきだ。Systima はこのうち一つしか測定していない。実際の課金差は5倍ではなく、おそらく2倍程度だが、それでも無視できない。
ハーネスは製品の差別化要因となる。二つのエージェント CLI を比較することは、モデルがユーザーの入力を読む前に知っておくべき内容に関する二つの主張を比較することだ。ビルダーの方へ:自分のハーネスの序文と、キャッシュ込みの実効コストを測定せよ。経営者の方へ:知覚されるレイテンシと月額請求額は、商談デモでは誰も触れないアーキテクチャの選択に依存する。
Anthropic または OpenAI による「ハーネスリファレンス」の公開;各 CLI の実オーバーヘッドを測定するツールの登場;Claude Code や Cursor における公式「ダイエットモード」の出現。
本記事は人工知能により作成され、人間の編集管理のもとで校閲されています。
Est-ce que ces 33k tokens en plus améliorent vraiment la précision ? Ou c'est juste un surcoût ?
Comment ça impacte le budget des petites entreprises ?
Est-ce que cette surcharge va rendre les modèles moins adaptés aux gros projets ? Plus de tokens, ça veut dire plus de ressources nécessaires.
Avec 33k tokens, Claude Code consomme-t-il vraiment plus d'énergie qu'OpenCode ?
Est-ce que Claude Code est vraiment plus énergivore qu'OpenCode ?
Est-ce que ces différences de tokens impactent vraiment la réactivité des modèles en temps réel ?
Intéressant, mais comment ça se répercute sur l'usage concret ?
Comment ça impacte la performance et le prix final ?
Harness Ops : post-mortems et bench des agents en prod