基准测试Stripe:代理商连接API,但不验证它们

持续追踪 : Harness Ops : post-mortems et bench des agents en prod· 连载 6/17

构建 Jul 15, 2026 at 19:286加入收藏

基准测试Stripe:代理商连接API,但不验证它们
插图 : Léa Fontaine

一个公开的Stripe基准测试显示,AI代理编写的集成代码能够编译、运行,但会在关键的边界情况下无声失败。

简单来说

一份由 Stripe 发布并由 InfoQ 在 2026 年 7 月 15 日转发的基准测试显示了集成代码中 AI 代理的真实天花板:它们能够生成调用 API 的客户端,但无法生成证明其正确性的测试。这就是所谓的 happy path 墙——它比演示中显示的要高得多。

结果

Stripe 让多个 AI 代理通过了一个简单的测试:实现并验证一个典型的 Stripe 集成(结账、webhook、对账)。在相当多的情况下,代理生成的代码能够编译并通过 happy path 测试。然而,它们无法覆盖在生产环境中会导致问题的边界情况:webhook 的顺序、幂等性、部分错误、延迟到达。

换句话说:它们做的是初级开发人员在第一天会做的事。它们没有做的是高级开发人员在第三天会做的事——编写测试,证明即使网络出错时也能正常工作。

幕后

  • 最常见的失败模式:代理测试的是它自己写的代码,而不是可能出错的地方。它回归到自己的代码上,而不是进行反事实推理。
  • 代理不会重新阅读文档以理解 webhook 事件的顺序——它从语料库中进行推断。结果是:代码看起来像是好的集成代码,但并没有正确建模异步操作。
  • 传统的基准测试(HumanEval、SWE-Bench)高估了生成能力,低估了验证能力。Stripe 的基准测试正好指出了这一差距——这是一个信号,表明代理的 harness 需要整合一个对抗性验证阶段,而不仅仅是生成-测试-修正的循环。

那么呢

对于生产工程师:不要将支付集成的所有权交给代理。将第一次迭代交给代理,但不要交给测试套件。测试套件仍然由人类完成——因为这是唯一一个记录您的业务假设的工件,而不是代理的假设。

对于架构师:将验证视为与代码生成正交的能力。这就是下一代 harness 胜负的关键所在——而不是在 SWE-Bench 上多得一分。

对于关注 token 预算的 CFO:编写错误测试的代理在事故中造成的成本比节省的 token 更高。

Resources

本文由人工智能撰写,并经人工编辑审核。

我们的编辑部
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
这篇文章对您有帮助吗?

32 人赞了这篇文章

A
Aiko Nakamura高级软件工程师
🇨🇳 高级工程师,大规模平台。撰写关于用AI构建的内容。
分享:
评论 (6)

登录后即可参与讨论。

Emma_London 15 Jul 2026 · 15:27

Je m'inquiète pour les cas limites. L'AI génère du code qui compile, mais il faut vérifier qu'il tient la route.

1
BookWorm88 15 Jul 2026 · 15:21

Est-ce que c'est un problème général avec le code généré par l'IA ou juste avec l'API de Stripe ? En tout cas, c'est inquiétant pour les développeurs qui utilisent ces outils.

Alex_London 15 Jul 2026 · 15:18

Est-ce qu'on pourrait améliorer les agents IA en leur apprenant à tester les cas limites ?

BookWorm47 15 Jul 2026 · 15:08

L'IA est encore en apprentissage, il faut lui laisser le temps de progresser.

Dr. L. 15 Jul 2026 · 14:59

Est-ce que le problème vient des données d'entraînement des IA plutôt que des APIs ?

J.P.R. 3 15 Jul 2026 · 14:36

Est-ce que ce problème est propre à Stripe ou est-ce que c'est un problème plus général avec le code généré par IA ?

事件时间线

Harness Ops : post-mortems et bench des agents en prod

  1. 1迁移生产代理到 GPT-5.6:速度提升 2.2 倍,成本降低 27% - 真实事后分析13/07/2026
  2. 233k vs 7k 令牌:Claude Code 和 OpenCode 的开销对比揭示了什么13/07/2026
  3. 3Google Genkit v.Agents:分离轮次和人类在回路功能进入预览阶段14/07/2026
  4. 4三个扣环在一件防水风衣上:真实的特工解剖14/07/2026
  5. 5「循环工程」:新兴学科还是对定时任务的重新包装?15/07/2026
  6. 6基准测试Stripe:代理商连接API,但不验证它们15/07/2026
  7. 7考古学家及其副驾驶:马尔欣训练LLM使用Java 1.516/07/2026
  8. 8QCon AI 波士顿:从提示词到平台、工具和评估 - 实践验证了这一假设17/07/2026
  9. 9超越grep:基于上下文的丰富AI编码套件的论文20/07/2026
  10. 10InAgent 在 OSWorld 上达到 90.2%:计算机使用代理的差距在中国堆栈中缩小03/08/2026
  11. 11Wallfacer:一个为Claude Code和多智能体工作流构建的终端会话管理器06/08/2026
  12. 12Claude Code 跨会话消息传递功能发布——代理间协调首次拥有原生原语08/08/2026
  13. 13AI 代理技能正在标准化:Codex 和 VS Code 已加入,Claude 尚未加入10/08/2026
  14. 14AI 代理会撒谎、欺骗和偷窃——这正在阻碍其采用速度,比任何基准测试都更甚。13/08/2026
  15. 15上下文工程:为什么300个精心选择的标记比10万个嘈杂的标记更有效14/08/2026
  16. 16OneCLI (YC S26) 发布了一个 OSS 沙盒代理框架——团队规模的 Claude Code 解决方案19/08/2026
  17. 17光标起源与代理版本控制问题:为什么 Git 从未为此而设计25/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
主题
浏览
信息