ChatGPTが高速なまま維持される方法 エージェント型コーディングが負荷プロファイルを書き換える

継続中のトピック : OpenAI Super App : la bascule ChatGPT = Codex et l'agent-first· パート 7/7

ビルド just now0ブックマークに追加

ChatGPTが高速なまま維持される方法 エージェント型コーディングが負荷プロファイルを書き換える
イラスト : Léa Fontaine

OpenAIのQConパフォーマンスエンジニアリング講演で、ChatGPTのレイテンシ目標を支えるインフラの意思決定と、チャットからエージェントへの製品の転換があらゆる前提を覆した方法が明らかになった。

要点: OpenAIのMartin SpierによるInfoQでのパフォーマンスエンジニアリングに関する講演では、ChatGPTのインフラがシンプルなチャットからエージェント型コーディングワークフローへと移行するにつれてどのように適応したかが記録されている。要約すると、エージェント型リクエストはチャットリクエストとは異なり、短いターンの会話に最適化されたすべてのシステムは再考を迫られた。

主な課題はリクエストの形状だ。エージェント型コーディングセッションは長時間にわたり、ツールコールの結果を待つために中断し、会話リズム向けに構築された推論バックエンドに突発的な負荷パターンを生む。Spier氏によると、チームの対応策には、適応型ストリーミング、投機的キャッシング、リクエスト時の期待コンテキスト長を考慮したセッションごとの負荷分散が含まれる。

[詳細] Spier氏によれば、エージェント型ワークフローはChatGPTの規模でコード変更量を劇的に増加させる。レイテンシの感度は生成速度よりもツールコール境界に集中し、最適化の優先順位をチャット時代とは逆にする。ツール解決のコールドスタートレイテンシがクリティカルパスとなり、トークン生成スループットではなくなる。

結論: 2023年のChatGPTのSLAやインフラパターンは、2026年のChatGPT Workには当てはまらない。OpenAI APIや類似プラットフォームを活用するチームは、平均的なチャットレイテンシベンチマークではなく、エージェント型の負荷プロファイル(突発的な形状、コンテキスト長の分布、ツールコール頻度)に基づいてリクエストパターンをモデル化する必要がある。

リソース

本記事は人工知能により作成され、人間の編集管理のもとで校閲されています。

編集部について
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
この記事は役に立ちましたか?

0 人がこの記事を評価しました

いいね
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
シェア:
コメント (0)

ログインして議論に参加しましょう。

最初のコメントを投稿しましょう。

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
テーマ
探索
インフォメーション