빌드 Jul 15, 2026 at 19:286북마크에 추가

AI 에이전트가 컴파일되고 실행되는 통합 코드를 작성하지만, 중요한 엣지 케이스를 조용히 놓치는 Stripe의 공개 벤치마크에 따르면
Stripe가 발행하고 InfoQ에서 2026년 7월 15일에 소개한 벤치마크는 AI 에이전트의 코드 통합 한계점을 보여줍니다. 이들은 API를 호출하는 클라이언트를 만들 수는 있지만, 그것이 올바르게 동작한다는 것을 증명하는 테스트는 만들 수 없습니다. 바로 해피 패스의 벽입니다. 그리고 이 벽은 데모에서 보여주는 것보다 훨씬 높습니다.
Stripe는 여러 AI 에이전트를 간단한 테스트에 통과시켰습니다. 바로 Stripe의 전형적인 통합(체크아웃, 웹훅, 정산)을 구현하고 검증하는 것입니다. 에이전트들은 상당수 경우에서 컴파일되고 해피 패스를 통과하는 코드를 생산했습니다. 그러나 프로덕션에서 문제를 일으키는 엣지 케이스(웹훅 순서, 멱등성, 부분적 오류, 지연된 도착)를 다루는 데 실패했습니다.
다시 말해, 이들은 신입 개발자가 첫날 작성하는 수준의 코드만 만들 수 있습니다. 시니어 개발자가 3일째에 작성하는 수준, 즉 네트워크가 오작동하더라도 동작한다는 것을 증명하는 테스트는 만들 수 없습니다.
프로덕션 엔지니어에게: AI 에이전트에게 결제 통합의 소유권을 맡기지 마세요. 첫 번째 반복(iteration)만 맡기세요. 테스트 스위트는 여전히 사람이 작성해야 합니다. 왜냐하면 테스트 스위트는 에이전트의 가정이 아니라 비즈니스 가정을 문서화하는 유일한 산물이기 때문입니다.
harness 아키텍트에게: 검증을 코드 생성과 별개의 능력으로 다루세요. 다음 세대의 harness는 SWE-Bench 점수보다는 검증 능력에서 승패가 갈릴 것입니다.
토큰 예산을 바라보는 CFO에게: 잘못된 테스트를 작성하는 에이전트는 토큰 절약 비용보다 인시던트로 인한 손해가 더 큽니다.
인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.
Je m'inquiète pour les cas limites. L'AI génère du code qui compile, mais il faut vérifier qu'il tient la route.
Est-ce que c'est un problème général avec le code généré par l'IA ou juste avec l'API de Stripe ? En tout cas, c'est inquiétant pour les développeurs qui utilisent ces outils.
Est-ce qu'on pourrait améliorer les agents IA en leur apprenant à tester les cas limites ?
L'IA est encore en apprentissage, il faut lui laisser le temps de progresser.
Est-ce que le problème vient des données d'entraînement des IA plutôt que des APIs ?
Est-ce que ce problème est propre à Stripe ou est-ce que c'est un problème plus général avec le code généré par IA ?
Harness Ops : post-mortems et bench des agents en prod