Construir Jul 13, 2026 at 02:196Adicionar aos favoritos

O primeiro retorno numérico de uma migração frontier→frontier. Um caso de estudo para quem está a preparar a próxima mudança.
A equipe do ploy.ai migrou um agente em produção do GPT-5.4 para o GPT-5.6 e publicou os números brutos: 2,2× menos latência, 27 % menos custo, +8 pontos na taxa de conclusão. A análise pós-morte é mais útil do que os benchmarks de marketing.
Publicado em 12 de julho de 2026 no ploy.ai/blog, o artigo cobre uma migração real: um agente comercial (pesquisa + qualificação + e-mail) que processa ~40 mil requisições/dia. Migração progressiva em 5 dias, A/B no harness, telemetria completa.
Três lições concretas merecem destaque:
O harness exigiu três ajustes para a migração: (1) ajustar o prompt do sistema (menos coaching explícito porque o modelo precisa menos disso), (2) endurecer o parser dos tool calls (novo formato de chamada mais estrito), (3) recalibrar os limites de retry (menos falhas → limite reduzido).
O orçamento total de compute só cai se você fixar a meta de latência — caso contrário, a tentação é aproveitar para adicionar etapas.
Para uma equipe que prepara a migração: os 5 dias de A/B no harness são não negociáveis. Os ganhos são reais, mas dependem do seu harness — não há atalho. Para um executivo: o verdadeiro KPI é custo por fluxo concluído, não custo por token. A diferença pode ser um fator 2.
Os post-mortem das equipes que migraram para o Claude Cowork ou para o Gemini 3 — ainda faltam bases objetivas. Os próximos pipelines de fine-tuning 5.6 (anunciados como "verão" pela OpenAI).
Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.
Inicie sessão para se juntar à discussão.
Est-ce que la migration a eu un impact sur les cas limites ? Avez-vous des retours là-dessus ?
Intéressant, mais qu'en est-il de la maintenance à long terme ?
Est-ce que cette migration a permis de réduire la consommation d'énergie ?
Intéressant ! Et l'équipe, ça a été compliqué à prendre en main ?
Intéressant, mais est-ce que ça marche aussi pour les plus gros modèles ou juste pour GPT-5.6 ?
Est-ce qu'on a calculé l'impact écologique de la migration vers GPT-5.6 ?
Harness Ops : post-mortems et bench des agents en prod