Anthropic libera o seu manual de instruções para escalar agentes: camadas, tokens, execução confiável

Seguimento do caso : Le coût du token entre dans le budget : quotas, CFO et rationnement de l'IA· Episódio 2/7

Construir Jul 15, 2026 at 12:344Adicionar aos favoritos

Anthropic libera o seu manual de instruções para escalar agentes: camadas, tokens, execução confiável
Ilustração : Léa Fontaine

Duas engenheiras da Anthropic publicam as lições do campo: em um agente que precisa escalar, não é mais o modelo que limita, mas o *harness*. Três pilares: camadas, orçamento, execução.

Em termos simples Duas engenheiras da Anthropic — Angela Jiang e Katelyn Lesse — publicam as lições aprendidas ao industrializar agentes de IA em clientes. A mensagem: não é o modelo que limita a escalabilidade, mas a arquitetura ao redor. Três pilares: dividir a stack em camadas, manter um orçamento rígido de tokens e garantir a execução.

O contexto

O discurso dominante em 2025 era: “os modelos vão dar conta”. O feedback da Anthropic reorienta a atenção em 2026: em fluxos longos de agentes, a confiabilidade vem do harness, não do modelo. Isso alinha com o que acompanhamos: o custo por token vira opex, Adam Mosseri cita limites de tokens por engenheiro (Meta), e licenças de IA são cortadas na Uber e Microsoft quando o orçamento estoura.

Os dados

  • Fonte primária: publicação de Angela Jiang e Katelyn Lesse (Anthropic), reportada pela Tech in Asia em 15/07/26.
  • Mensagem-chave: a escalabilidade de IA em empresas depende de uma arquitetura em camadas, estratégia de tokens e execução confiável — não apenas de modelos melhores.

Under the hood

O padrão “arquitetura em camadas” separa, na prática, três responsabilidades:

  1. Orquestração — decide qual agente roda, com qual orçamento de tokens e qual prazo. É a camada que recusa um run se o orçamento estoura.
  2. Execução — executa cada tool-call com retry, timeouts, validação de saída e idempotência. Sem isso, um agente que “funciona” na demo vira um incidente em produção.
  3. Estado — persiste o que deve sobreviver entre turnos: artefatos e decisões, não todo o contexto da conversa. O contexto tem custo, então é racionado.

O orçamento de tokens é a restrição estruturante: se um agente pode queimar 500k tokens por run e roda 1000 vezes por dia, o custo supera rapidamente o salário de um engenheiro júnior. O orçamento é definido no nível da arquitetura — não no prompt.

Cenários & Riscos

  • Curto prazo: equipes que constroem agentes sem teto de tokens serão cobradas pelo CFO (o fio token-budget-caps já documenta casos na Uber, Microsoft, Mosseri).
  • Risco de produto: passar para execução confiável exige instrumentação — traces, replays, custo por run — que a maioria dos agentes-demo ignora. Muitos POCs não sobreviverão a esse custo de instrumentação.

E então

Para uma lead engenharia que pilota um projeto de agente em 2026: o lote 1 não é mais engenharia de prompt. É orçamento e rastreamento. Instrumentem o custo por run antes de adicionar capabilities. Senão, a conversa com a área financeira chegará no pior momento — quando o agente finalmente começar a funcionar.

Resources

Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.

A nossa redação
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Este artigo foi-lhe útil?

30 pessoas gostaram deste artigo

Gosto
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
Partilhar:
Comentários (4)

Inicie sessão para se juntar à discussão.

HistoryBuff 15 Jul 2026 · 09:07

Comment ça marche avec plusieurs APIs ?

Dr. J. 15 Jul 2026 · 08:27

Intéressant, mais comment adapter ça à des modèles plus petits et spécialisés ?

GreenThumb 15 Jul 2026 · 10:42

Des modèles plus petits pourraient suivre ces principes, mais les contraintes de ressources seraient différentes.

TravelTom 15 Jul 2026 · 08:17

Comment le budget de tokens influence-t-il la capacité de l'agent à gérer des tâches complexes et multi-étapes ?

CriticAtHeart 15 Jul 2026 · 07:59

Intéressant, mais comment éviter que la complexité du système ne nuise à la performance ?

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secções
Explorar
Informações