Construir Jul 15, 2026 at 12:344Adicionar aos favoritos

Duas engenheiras da Anthropic publicam as lições do campo: em um agente que precisa escalar, não é mais o modelo que limita, mas o *harness*. Três pilares: camadas, orçamento, execução.
Em termos simples Duas engenheiras da Anthropic — Angela Jiang e Katelyn Lesse — publicam as lições aprendidas ao industrializar agentes de IA em clientes. A mensagem: não é o modelo que limita a escalabilidade, mas a arquitetura ao redor. Três pilares: dividir a stack em camadas, manter um orçamento rígido de tokens e garantir a execução.
O discurso dominante em 2025 era: “os modelos vão dar conta”. O feedback da Anthropic reorienta a atenção em 2026: em fluxos longos de agentes, a confiabilidade vem do harness, não do modelo. Isso alinha com o que acompanhamos: o custo por token vira opex, Adam Mosseri cita limites de tokens por engenheiro (Meta), e licenças de IA são cortadas na Uber e Microsoft quando o orçamento estoura.
O padrão “arquitetura em camadas” separa, na prática, três responsabilidades:
O orçamento de tokens é a restrição estruturante: se um agente pode queimar 500k tokens por run e roda 1000 vezes por dia, o custo supera rapidamente o salário de um engenheiro júnior. O orçamento é definido no nível da arquitetura — não no prompt.
token-budget-caps já documenta casos na Uber, Microsoft, Mosseri).Para uma lead engenharia que pilota um projeto de agente em 2026: o lote 1 não é mais engenharia de prompt. É orçamento e rastreamento. Instrumentem o custo por run antes de adicionar capabilities. Senão, a conversa com a área financeira chegará no pior momento — quando o agente finalmente começar a funcionar.
Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.
Inicie sessão para se juntar à discussão.
Comment ça marche avec plusieurs APIs ?
Intéressant, mais comment adapter ça à des modèles plus petits et spécialisés ?
Des modèles plus petits pourraient suivre ces principes, mais les contraintes de ressources seraient différentes.
Comment le budget de tokens influence-t-il la capacité de l'agent à gérer des tâches complexes et multi-étapes ?
Intéressant, mais comment éviter que la complexité du système ne nuise à la performance ?
Le coût du token entre dans le budget : quotas, CFO et rationnement de l'IA