Как OpenAI сохраняет высокую скорость ChatGPT, когда agentic-кодинг меняет профиль нагрузки

Продолжение истории : OpenAI Super App : la bascule ChatGPT = Codex et l'agent-first· Часть 7/7

Строительство just now0В закладки

Как OpenAI сохраняет высокую скорость ChatGPT, когда agentic-кодинг меняет профиль нагрузки
Иллюстрация : Léa Fontaine

A доклад OpenAI на QCon по инженерии производительности раскрывает инфраструктурные решения, лежащие в основе целевых показателей задержки ChatGPT — и как переход продукта от чат-бота к агенту изменил все предположения.

Простыми словами: Доклад по инженерной производительности от Мартина Спира (OpenAI), опубликованный на InfoQ, документирует, как инфраструктура ChatGPT адаптировалась по мере того, как продукт эволюционировал от простого чата к агентным рабочим процессам для программирования. Кратко: агентные запросы не похожи на чат-запросы, и всё, что было оптимизировано для коротких диалогов, потребовало переосмысления.

Основная проблема — форма запроса. Агентные сессии программирования длятся дольше, они могут останавливаться в середине, ожидая результатов вызовов инструментов, и создают неравномерную нагрузку на бэкенды инференса, рассчитанные на ритм диалога. Команда решила эту задачу с помощью адаптивной потоковой передачи, спекулятивного кэширования и балансировки нагрузки на уровне сессий, учитывающей ожидаемую длину контекста на этапе запроса — а не только на этапе планирования.

[Под капотом] Как отмечает Спир, агентные рабочие процессы значительно увеличивают объём изменений кода в масштабах ChatGPT. Чувствительность к задержкам концентрируется на границах вызовов инструментов, а не на скорости генерации — что меняет приоритеты оптимизации по сравнению с эпохой чатов. Холодный старт при разрешении инструментов становится критическим путём, а не пропускная способность генерации токенов.

Итак: SLA-гипотезы и паттерны инфраструктуры ChatGPT 2023 года не подходят для ChatGPT Work 2026 года. Командам, работающим поверх OpenAI API или аналогичных платформ, необходимо моделировать свои паттерны запросов с учётом профилей агентной нагрузки — формы всплесков, распределения длины контекста и частоты вызовов инструментов, а не средних бенчмарков задержки в чатах.

Resources

Статья создана искусственным интеллектом и проверена под редакционным контролем человека.

Наша редакция
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Была ли статья полезной?

0 чел. оценили эту статью

Нравится
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
Поделиться:
Комментарии (0)

Войдите, чтобы участвовать в обсуждении.

Оставьте первый комментарий.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Темы
Обзор
Информация