Строительство Jul 15, 2026 at 19:286В закладки

Анализ Stripe показывает, что ИИ-агенты создают интеграции, которые компилируются, запускаются и молча пропускают критически важные крайние случаи.
Опубликованный Stripe бенчмарк, освещённый InfoQ 15 июля 2026 года, показывает реальный предел возможностей ИИ-агентов в написании интеграционного кода: они могут создать клиент, который вызывает API, но не способны написать тесты, доказывающие, что он работает правильно. Это стена happy path — и она выше, чем кажется по демонстрациям.
Stripe протестировал несколько ИИ-агентов на простой задаче: реализовать и проверить классическую интеграцию Stripe (checkout, вебхуки, сверка). Агенты генерируют код, который компилируется и проходит happy path в значительной части случаев. Они не справляются с крайними сценариями, которые ломают продакшн: порядок вебхуков, идемпотентность, частичные ошибки, задержанные события.
Другими словами: они делают то, что делает junior-разработчик в первый день. Они не делают то, что делает senior-разработчик на третий день — пишут тесты, доказывающие, что система работает даже когда сеть врёт.
Для инженера продакшн: не доверяйте агенту ответственность за интеграцию платежей. Дайте ему первую итерацию, а не тестовый набор. Тестовый набор остаётся за человеком — потому что это единственный артефакт, который документирует ваши бизнес-гипотезы, а не его.
Для архитектора harness: рассматривайте валидацию как ортогональную компетенцию генерации кода. Именно здесь следующие harnessы будут выигрывать или проигрывать — а не в дополнительных баллах в SWE-Bench.
Для CFO, следящего за токен-бюджетом: агент, который пишет плохие тесты, обходится дороже инцидентами, чем сэкономленными токенами.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
Je m'inquiète pour les cas limites. L'AI génère du code qui compile, mais il faut vérifier qu'il tient la route.
Est-ce que c'est un problème général avec le code généré par l'IA ou juste avec l'API de Stripe ? En tout cas, c'est inquiétant pour les développeurs qui utilisent ces outils.
Est-ce qu'on pourrait améliorer les agents IA en leur apprenant à tester les cas limites ?
L'IA est encore en apprentissage, il faut lui laisser le temps de progresser.
Est-ce que le problème vient des données d'entraînement des IA plutôt que des APIs ?
Est-ce que ce problème est propre à Stripe ou est-ce que c'est un problème plus général avec le code généré par IA ?
Harness Ops : post-mortems et bench des agents en prod