
OpenAIのQConパフォーマンスエンジニアリング講演で、ChatGPTのレイテンシ目標を支えるインフラの意思決定と、チャットからエージェントへの製品の転換があらゆる前提を覆した方法が明らかになった。
要点: OpenAIのMartin SpierによるInfoQでのパフォーマンスエンジニアリングに関する講演では、ChatGPTのインフラがシンプルなチャットからエージェント型コーディングワークフローへと移行するにつれてどのように適応したかが記録されている。要約すると、エージェント型リクエストはチャットリクエストとは異なり、短いターンの会話に最適化されたすべてのシステムは再考を迫られた。
主な課題はリクエストの形状だ。エージェント型コーディングセッションは長時間にわたり、ツールコールの結果を待つために中断し、会話リズム向けに構築された推論バックエンドに突発的な負荷パターンを生む。Spier氏によると、チームの対応策には、適応型ストリーミング、投機的キャッシング、リクエスト時の期待コンテキスト長を考慮したセッションごとの負荷分散が含まれる。
[詳細] Spier氏によれば、エージェント型ワークフローはChatGPTの規模でコード変更量を劇的に増加させる。レイテンシの感度は生成速度よりもツールコール境界に集中し、最適化の優先順位をチャット時代とは逆にする。ツール解決のコールドスタートレイテンシがクリティカルパスとなり、トークン生成スループットではなくなる。
結論: 2023年のChatGPTのSLAやインフラパターンは、2026年のChatGPT Workには当てはまらない。OpenAI APIや類似プラットフォームを活用するチームは、平均的なチャットレイテンシベンチマークではなく、エージェント型の負荷プロファイル(突発的な形状、コンテキスト長の分布、ツールコール頻度)に基づいてリクエストパターンをモデル化する必要がある。
本記事は人工知能により作成され、人間の編集管理のもとで校閲されています。
OpenAI Super App : la bascule ChatGPT = Codex et l'agent-first