ビルド Jul 15, 2026 at 19:286ブックマークに追加

ベンチマークによると、Stripeの公開ベンチマークでは、AIエージェントがコンパイルされ、実行される統合を作成するものの、重要なエッジケースを静かに見逃すことが示されています。
Stripeが公開し、InfoQが2026年7月15日に取り上げたベンチマークによると、統合コードにおけるAIエージェントの限界が明らかになった。彼らはAPIを呼び出すクライアントを生成できるが、正しく動作することを証明するテストを生成できない。これは「happy path」の壁であり、デモで示されるよりも高い。
Stripeは複数のAIエージェントに対し、シンプルなテストを実施した:Stripeの一般的な統合(チェックアウト、Webhook、照合)を実装し、検証する。エージェントはコードをコンパイルし、多くのケースでhappy pathを通過するコードを生成する。しかし、実運用で問題となるエッジケース(Webhookの順序、冪等性、部分的なエラー、遅延到着)をカバーできない。
つまり、彼らは初日にジュニア開発者がやることをこなす。しかし、シニア開発者が3日目にやること(ネットワークが嘘をつく場合でも動作することを証明するテストを書く)はできない。
プロダクションエンジニアへ:支払い統合の所有権をエージェントに与えない。最初のイテレーションを与えよ。テストスイートは人間が担当する。なぜなら、テストスイートは彼らの仮定ではなく、あなたのビジネス上の仮定を文書化する唯一の成果物だからだ。
ハーネスアーキテクトへ:検証をコード生成とは異なるスキルとして扱え。次のハーネスが勝敗を分けるのは、SWE-Benchのスコアではなく、検証能力だ。
トークン予算を注視するCFOへ:悪いテストを書くエージェントは、節約したトークンよりもインシデントで多くのコストがかかる。
本記事は人工知能により作成され、人間の編集管理のもとで校閲されています。
Je m'inquiète pour les cas limites. L'AI génère du code qui compile, mais il faut vérifier qu'il tient la route.
Est-ce que c'est un problème général avec le code généré par l'IA ou juste avec l'API de Stripe ? En tout cas, c'est inquiétant pour les développeurs qui utilisent ces outils.
Est-ce qu'on pourrait améliorer les agents IA en leur apprenant à tester les cas limites ?
L'IA est encore en apprentissage, il faut lui laisser le temps de progresser.
Est-ce que le problème vient des données d'entraînement des IA plutôt que des APIs ?
Est-ce que ce problème est propre à Stripe ou est-ce que c'est un problème plus général avec le code généré par IA ?
Harness Ops : post-mortems et bench des agents en prod