Строительство Jul 13, 2026 at 02:196В закладки

Первый количественный отчёт о миграции с frontier на frontier. Учебный случай для тех, кто готовит свою следующую перестройку.
Команда ploy.ai перенесла агента из продакшена с GPT-5.4 на GPT-5.6 и опубликовала сырые цифры: на 2,2× меньше задержка, на 27 % ниже стоимость, +8 п.п. к доле успешных завершений. Постмортем оказался полезнее маркетинговых бенчмарков.
Опубликовано 12 июля 2026 года на ploy.ai/blog, отчёт охватывает реальную миграцию: коммерческий агент (поиск + квалификация + email), обрабатывающий ~40k запросов/день. Постепенный переход в течение 5 дней, A/B-тестирование на стороне harness, полная телеметрия.
Стоит выделить три конкретных урока:
Для перехода harness потребовалось три изменения: (1) корректировка системного промпта (меньше явных подсказок, так как модель в них нуждается меньше), (2) ужесточение парсера tool calls (новый, более строгий формат вызовов), (3) перекалибровка порогов retry (меньше ошибок → порог снижен).
Общий вычислительный бюджет снижается только если вы фиксируете целевую задержку — иначе появляется соблазн добавить дополнительные шаги.
Для команды, готовящей переход: 5 дней A/B-тестирования на стороне harness — обязательны. Выгоды реальны, но зависят от вашего harness — никаких shortcut. Для руководителя: ключевой KPI — стоимость на успешный workflow, а не стоимость за токен. Разница может быть в 2 раза.
Постмортемы команд, мигрировавших на Claude Cowork или Gemini 3 — объективные бенчмарки пока отсутствуют. Предстоящие пайплайны fine-tuning 5.6 (запланированы OpenAI на «лето»).
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
Est-ce que la migration a eu un impact sur les cas limites ? Avez-vous des retours là-dessus ?
Intéressant, mais qu'en est-il de la maintenance à long terme ?
Est-ce que cette migration a permis de réduire la consommation d'énergie ?
Intéressant ! Et l'équipe, ça a été compliqué à prendre en main ?
Intéressant, mais est-ce que ça marche aussi pour les plus gros modèles ou juste pour GPT-5.6 ?
Est-ce qu'on a calculé l'impact écologique de la migration vers GPT-5.6 ?
Harness Ops : post-mortems et bench des agents en prod