Construir Jul 13, 2026 at 02:196Añadir a favoritos

El primer retorno cuantificado de una migración frontier→frontier. Un caso de estudio para quienes preparan su próxima transición.
El equipo de ploy.ai migró un agente en producción de GPT-5.4 a GPT-5.6 y publicó las cifras brutas: 2,2× menos de latencia, 27 % menos de costo, +8 puntos en tasa de finalización. El post-mortem es más útil que los benchmarks de marketing.
Publicado el 12 de julio de 2026 en ploy.ai/blog, el informe cubre una migración real: un agente comercial (búsqueda + cualificación + email) que procesa ~40k solicitudes/día. Implementación progresiva en 5 días, A/B en el harness, telemetría completa.
Tres aprendizajes concretos merecen ser destacados:
El harness requirió tres modificaciones para la migración: (1) ajustar el prompt del sistema (menos coaching explícito porque el modelo lo necesita menos), (2) endurecer el parser de llamadas a herramientas (nuevo formato de llamada más estricto), (3) recalibrar los umbrales de reintento (menos fallos → umbral reducido).
El presupuesto total de cómputo solo baja si fijas el objetivo de latencia; de lo contrario, la tentación es aprovecharlo para añadir pasos.
Para un equipo que prepara la migración: los 5 días de A/B en el harness son no negociables. Los beneficios son reales, pero dependen de tu harness — no hay atajos. Para un directivo: el KPI real es costo por flujo exitoso, no costo por token. La diferencia puede ser un factor de 2.
Los post-mortem de equipos que migraron a Claude Cowork o a Gemini 3 — aún faltan líneas base objetivas. Los próximos pipelines de fine-tuning 5.6 (anunciados para «verano» por OpenAI).
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
Est-ce que la migration a eu un impact sur les cas limites ? Avez-vous des retours là-dessus ?
Intéressant, mais qu'en est-il de la maintenance à long terme ?
Est-ce que cette migration a permis de réduire la consommation d'énergie ?
Intéressant ! Et l'équipe, ça a été compliqué à prendre en main ?
Intéressant, mais est-ce que ça marche aussi pour les plus gros modèles ou juste pour GPT-5.6 ?
Est-ce qu'on a calculé l'impact écologique de la migration vers GPT-5.6 ?
Harness Ops : post-mortems et bench des agents en prod