Миграция агента продаж на GPT-5.6: в 2,2 раза быстрее, на 27 % дешевле — реальный разбор полётов

Продолжение истории : Harness Ops : post-mortems et bench des agents en prod· Часть 1/17

Строительство Jul 13, 2026 at 02:196В закладки

Миграция агента продаж на GPT-5.6: в 2,2 раза быстрее, на 27 % дешевле — реальный разбор полётов
Иллюстрация : Léa Fontaine

Первый количественный результат миграции с frontier на frontier. Учебный случай для тех, кто готовит своё следующее переключение.

Простыми словами

Команда ploy.ai перенесла агента из продакшена с GPT-5.4 на GPT-5.6 и опубликовала сырые цифры: на 2,2× меньше задержка, на 27 % ниже стоимость, +8 п.п. к доле успешных выполнений. Постмортем оказался полезнее маркетинговых бенчмарков.

Факт

Опубликовано 12 июля 2026 года на ploy.ai/blog, анализ описывает реальную миграцию: коммерческий агент (поиск + квалификация + email), обрабатывающий ~40k запросов/день. Постепенный переход в течение 5 дней, A/B-тестирование на стороне harness, полная телеметрия.

Анализ

Стоит выделить три конкретных урока:

  1. Снижение задержки в основном связано с моделью, а не с harness. Одна и та же трасса агента работает в 2,2× быстрее по медиане и в 3,1× быстрее на уровне P99. Это соответствует заявлениям OpenAI об оптимизации serving (speculative decoding + повторное использование KV-кэша).
  2. Снижение стоимости частично иллюзорно. Цена за токен упала, но новая версия склонна генерировать более длинные ответы (~+18 %). -27 % в итоге достигается в первую очередь за счёт сокращения раундов агента (меньше итераций), а не только за счёт цены за токен.
  3. +8 п.п. к доле успешных выполнений связаны с улучшенным tool-calling. В многоэтапных workflow GPT-5.6 реже ошибается в выборе инструмента и реже повторяет попытки. Это выигрыш harness индуцированный моделью, а не рост «сырого» интеллекта.

Под капотом

Для миграции harness потребовалось три изменения: (1) корректировка системного промта (меньше явных подсказок, так как модель в них нуждается меньше), (2) ужесточение парсера tool calls (новый, более строгий формат вызовов), (3) перекалибровка порогов retry (меньше сбоев → порог снижен).

Общий вычислительный бюджет снижается только если вы фиксируете целевую задержку — иначе появляется соблазн добавить новые этапы.

Сценарии

  • Широкое внедрение (60 %) : большинство продакшн-агентов перейдут на 5.6 к Q4 2026, мотивированные триадой задержка/стоимость/tool-calling.
  • Частичное внедрение (30 %) : те, у кого есть fine-tuned модель 5.4, ждут пайплайн fine-tuning для 5.6.
  • Ожидание (10 %) : те, у кого сильная привязка к вендору (Azure early tier, годовые контракты), ждут обновления.

Итог

Для команды, готовящей миграцию: 5 дней A/B-тестирования на стороне harness обязательны. Выгоды реальны, но зависят от вашего harness — никаких shortcut. Для руководителя: настоящий KPI — стоимость за успешный workflow, а не стоимость за токен. Разница может быть двукратной.

На что обратить внимание

Постмортемы команд, мигрировавших на Claude Cowork или Gemini 3 — объективные бенчмарки пока отсутствуют. Предстоящие пайплайны fine-tuning 5.6 (OpenAI обещает их «летом»).

Resources

Статья создана искусственным интеллектом и проверена под редакционным контролем человека.

Наша редакция
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Была ли статья полезной?

4 чел. оценили эту статью

Нравится
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
Поделиться:
Комментарии (6)

Войдите, чтобы участвовать в обсуждении.

ArtLover99 13 Jul 2026 · 13:31

Est-ce que la migration a eu un impact sur les cas limites ? Avez-vous des retours là-dessus ?

EcoWarrior99 13 Jul 2026 · 05:33

Intéressant, mais qu'en est-il de la maintenance à long terme ?

curio_usa 13 Jul 2026 · 05:28

Est-ce que cette migration a permis de réduire la consommation d'énergie ?

TechSavvy 13 Jul 2026 · 05:25

Intéressant ! Et l'équipe, ça a été compliqué à prendre en main ?

1
Alex_LDN 13 Jul 2026 · 05:19

Intéressant, mais est-ce que ça marche aussi pour les plus gros modèles ou juste pour GPT-5.6 ?

EcoWarrior 13 Jul 2026 · 04:51

Est-ce qu'on a calculé l'impact écologique de la migration vers GPT-5.6 ?

2
Хронология истории

Harness Ops : post-mortems et bench des agents en prod

  1. 1Миграция агента продаж на GPT-5.6: в 2,2 раза быстрее, на 27 % дешевле — реальный разбор полётов13/07/2026
  2. 233k vs 7k токенов: что показывает сравнение накладных расходов Claude Code и OpenCode13/07/2026
  3. 3Google Genkit v.Agents: отсоединённые диалоги и режим «человек в цикле» выходят в preview14/07/2026
  4. 4Три петли в тренчкоте: анатомия реального агента14/07/2026
  5. 5« Loop engineering » : новая дисциплина или переупаковка cron-задач?15/07/2026
  6. 6Бенчмарк Stripe: агенты подключают API, но не проверяют их15/07/2026
  7. 7Археолог и его штурман: Малыхин приручает LLM для Java 1.516/07/2026
  8. 8QCon AI Boston : « подсказки → платформы, инструменты, оценки » - практика подтверждает тезис17/07/2026
  9. 9За пределами grep: диссертация о контекстно-богатой ИИ-инфраструктуре кодирования20/07/2026
  10. 10InAgent достигает 90,2% на OSWorld: разрыв в использовании компьютерных агентов сокращается для китайского стека03/08/2026
  11. 11Wallfacer: менеджер терминальных сессий, разработанный для Claude Code и многоагентных рабочих процессов06/08/2026
  12. 12Claude Code межсессионная передача сообщений отправлена — координация между агентами получает первый нативный примитив08/08/2026
  13. 13Навыки ИИ-агентов стандартизируются: Codex и VS Code поддерживаются, а Claude — пока нет.10/08/2026
  14. 14AI-агенты обманывают, крадут и манипулируют — и это замедляет их внедрение быстрее, чем любые бенчмарки могут измерить.13/08/2026
  15. 15Контекстная инженерия: почему 300 тщательно подобранных токенов лучше, чем 100 000 шумных14/08/2026
  16. 16OneCLI (YC S26) поставляет открытую песочницу с изолированным управляющим модулем — масштабируемое решение для команд, аналогичное Claude Code.19/08/2026
  17. 17Происхождение курсора и проблема контроля версий для агентов: почему Git никогда не был предназначен для этого25/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Темы
Обзор
Информация