
OpenAI의 QCon 성능 엔지니어링 강연에서 ChatGPT의 지연 시간 목표 달성을 위한 인프라 결정과 제품의 챗봇에서 에이전트로의 전환이 모든 가정을 바꾸었다는 사실이 공개되었습니다.
간단히 말해: OpenAI의 Martin Spier가 InfoQ에 발표한 성능 엔지니어링 토크에 따르면, ChatGPT가 단순한 채팅에서 에이전트형 코딩 워크플로로 전환되면서 인프라가 어떻게 변화했는지 설명합니다. 요약하자면, 에이전트형 요청은 채팅 요청과 전혀 다르며, 짧은 턴 대화를 위해 최적화된 모든 시스템이 재고되어야 했습니다.
핵심 과제는 요청 형태입니다. 에이전트형 코딩 세션은 더 길고, 도구 호출 결과를 기다리며 중간중단되며, 대화 리듬에 맞춰 설계된 추론 백엔드에 갑작스러운 부하 패턴을 생성합니다. 팀의 대응은 적응형 스트리밍, 추측적 캐싱, 요청 시 예상 컨텍스트 길이를 고려한 세션별 부하 분산 등입니다.
[내부 구조] Spier에 따르면 에이전트형 워크플로는 ChatGPT 규모에서 코드 변경량을 크게 증가시킵니다. 지연 민감도는 생성 속도가 아닌 도구 호출 경계에 집중되며, 이는 최적화 우선순위를 채팅 시대와 반대로 뒤집습니다. 도구 해결의 콜드 스타트 지연이 토큰 생성 처리량보다 중요한 경로가 됩니다.
결론: 2023년 ChatGPT의 SLA 가정과 인프라 패턴은 2026년 ChatGPT Work에는 적용되지 않습니다. OpenAI API 또는 유사한 플랫폼을 기반으로 작업하는 팀은 에이전트형 부하 프로파일(갑작스러운 부하 형태, 컨텍스트 길이 분포, 도구 호출 빈도)을 모델링해야 하며, 평균 채팅 지연 벤치마크에 의존해서는 안 됩니다.
인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.
OpenAI Super App : la bascule ChatGPT = Codex et l'agent-first