Cómo OpenAI mantiene a ChatGPT rápido mientras el desarrollo de agentes de codificación reescribe el perfil de carga

Seguimiento del caso : OpenAI Super App : la bascule ChatGPT = Codex et l'agent-first· Episodio 7/7

Construir just now0Añadir a favoritos

Cómo OpenAI mantiene a ChatGPT rápido mientras el desarrollo de agentes de codificación reescribe el perfil de carga
Ilustración : Léa Fontaine

Una charla de OpenAI en QCon sobre ingeniería de rendimiento revela las decisiones de infraestructura detrás de los objetivos de latencia de ChatGPT, y cómo el cambio del producto de chat a agente alteró cada suposición.

En términos sencillos: Una charla de ingeniería de rendimiento de Martin Spier (OpenAI), publicada en InfoQ, documenta cómo la infraestructura de ChatGPT se adaptó a medida que el producto evolucionó de un simple chat a flujos de trabajo de codificación agentica. La versión resumida: las solicitudes agenticas no se parecen a las solicitudes de chat, y todo lo optimizado para conversaciones de turno corto necesitó replantearse.

El desafío central es la forma de la solicitud. Las sesiones de codificación agentica son más largas, se detienen a mitad del flujo esperando resultados de llamadas a herramientas, y generan patrones de carga intermitente en los backends de inferencia diseñados para el ritmo conversacional. La respuesta del equipo implica streaming adaptativo, caché especulativa y equilibrio de carga por sesión que tiene en cuenta la longitud esperada del contexto en el momento de la solicitud, no solo en el momento de la programación.

[Bajo el capó] Según Spier, los flujos de trabajo agenticos aumentan drásticamente el volumen de cambios de código a la escala de ChatGPT. La sensibilidad a la latencia se concentra en los límites de las llamadas a herramientas en lugar de la velocidad de generación, lo que invierte la prioridad de optimización respecto a la era del chat. La latencia de inicio en frío en la resolución de herramientas se convierte en la ruta crítica, no el rendimiento de generación de tokens.

Entonces, ¿qué: Las suposiciones de SLA y los patrones de infraestructura de ChatGPT de 2023 no se aplican a ChatGPT Work de 2026. Los equipos que construyen sobre las APIs de OpenAI o plataformas similares deben modelar sus patrones de solicitud frente a perfiles de carga agentica: forma de ráfaga, distribución de longitud de contexto y frecuencia de llamadas a herramientas, no los puntos de referencia de latencia promedio del chat.

Resources

Artículo producido por inteligencia artificial, revisado bajo control editorial humano.

Nuestra redacción
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
¿Te ha resultado útil este artículo?

0 personas han valorado este artículo

Me gusta
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
Compartir:
Comentarios (0)

Inicia sesión para unirte a la conversación.

Sé el primero en comentar.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secciones
Explorar
Información