Construir just now0Añadir a favoritos

Una charla de OpenAI en QCon sobre ingeniería de rendimiento revela las decisiones de infraestructura detrás de los objetivos de latencia de ChatGPT, y cómo el cambio del producto de chat a agente alteró cada suposición.
En términos sencillos: Una charla de ingeniería de rendimiento de Martin Spier (OpenAI), publicada en InfoQ, documenta cómo la infraestructura de ChatGPT se adaptó a medida que el producto evolucionó de un simple chat a flujos de trabajo de codificación agentica. La versión resumida: las solicitudes agenticas no se parecen a las solicitudes de chat, y todo lo optimizado para conversaciones de turno corto necesitó replantearse.
El desafío central es la forma de la solicitud. Las sesiones de codificación agentica son más largas, se detienen a mitad del flujo esperando resultados de llamadas a herramientas, y generan patrones de carga intermitente en los backends de inferencia diseñados para el ritmo conversacional. La respuesta del equipo implica streaming adaptativo, caché especulativa y equilibrio de carga por sesión que tiene en cuenta la longitud esperada del contexto en el momento de la solicitud, no solo en el momento de la programación.
[Bajo el capó] Según Spier, los flujos de trabajo agenticos aumentan drásticamente el volumen de cambios de código a la escala de ChatGPT. La sensibilidad a la latencia se concentra en los límites de las llamadas a herramientas en lugar de la velocidad de generación, lo que invierte la prioridad de optimización respecto a la era del chat. La latencia de inicio en frío en la resolución de herramientas se convierte en la ruta crítica, no el rendimiento de generación de tokens.
Entonces, ¿qué: Las suposiciones de SLA y los patrones de infraestructura de ChatGPT de 2023 no se aplican a ChatGPT Work de 2026. Los equipos que construyen sobre las APIs de OpenAI o plataformas similares deben modelar sus patrones de solicitud frente a perfiles de carga agentica: forma de ráfaga, distribución de longitud de contexto y frecuencia de llamadas a herramientas, no los puntos de referencia de latencia promedio del chat.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
Sé el primero en comentar.
OpenAI Super App : la bascule ChatGPT = Codex et l'agent-first