Anthropic libera su manual de uso para escalar agentes: capas, tokens, ejecución confiable

Seguimiento del caso : Le coût du token entre dans le budget : quotas, CFO et rationnement de l'IA· Episodio 2/7

Construir Jul 15, 2026 at 12:344Añadir a favoritos

Anthropic libera su manual de uso para escalar agentes: capas, tokens, ejecución confiable
Ilustración : Léa Fontaine

Dos ingenieras de Anthropic publican las lecciones de campo: en un agente que debe escalar, ya no es el modelo lo que limita, sino el *harness*. Tres pilares: capas, presupuesto y ejecución.

En términos sencillos Dos ingenieras de Anthropic —Angela Jiang y Katelyn Lesse— publican las lecciones aprendidas al industrializar agentes de IA en sus clientes. El mensaje: no es el modelo lo que limita la escalabilidad, sino la arquitectura que lo rodea. Tres pilares: dividir la pila en capas, mantener un estricto presupuesto de tokens y garantizar la ejecución.

El contexto

El discurso dominante en 2025 era: «los modelos lo lograrán». La experiencia de Anthropic en 2026 reorienta la atención: en flujos de agentes largos, la fiabilidad proviene del harness, no del modelo. Coincide con lo que seguimos: el costo por token se desliza hacia el opex, Adam Mosseri menciona límites de tokens por ingeniero (Meta), y las licencias de IA se recortan en Uber y Microsoft cuando el presupuesto se desborda.

Los datos

  • Fuente primaria: publicación de Angela Jiang y Katelyn Lesse (Anthropic), reportada por Tech in Asia el 15/07/26.
  • Mensaje clave reportado: la escalabilidad de IA en empresas depende de una arquitectura por capas, una estrategia de tokens y una ejecución fiable —no solo de mejores modelos.

Under the hood

El patrón «arquitectura por capas» separa tres responsabilidades:

  1. Orquestación — decide qué agente se ejecuta, con qué presupuesto de tokens y qué plazo. Es la capa que rechaza un run si el presupuesto se dispara.
  2. Ejecución — ejecuta cada tool-call con reintentos, timeouts, validación de salida e idempotencia. Sin esto, un agente que «funciona» en demo se convierte en un incidente en producción.
  3. Estado — persiste lo que debe sobrevivir entre turnos: artefactos y decisiones, no todo el contexto de conversación. El contexto tiene costo, así que se raciona.

El presupuesto de tokens es la restricción estructurante: si un agente puede quemar 500k tokens por run y se ejecuta 1000 veces al día, el costo supera rápidamente el salario de un ingeniero junior. El presupuesto se gestiona a nivel de arquitectura —no en el prompt.

Escenarios y riesgos

  • Corto plazo: los equipos que construyen agentes sin límite de tokens serán alcanzados por el CFO (el hilo token-budget-caps ya documenta casos en Uber, Microsoft y Mosseri).
  • Riesgo de producto: lograr una ejecución fiable obliga a instrumentar —trazas, replays, costo por run— algo que la mayoría de demos de agentes ignoran. Muchos POC no sobrevivirán a este costo de instrumentación.

Entonces, ¿qué?

Para una lead engineering que gestiona un proyecto de agente en 2026: el sprint 1 ya no es prompt engineering. Es el presupuesto y el rastreo. Instrumente el costo por runantes de añadir capacidades. De lo contrario, la conversación con Finanzas llegará en el peor momento: cuando el agente por fin funcione.

Resources

Artículo producido por inteligencia artificial, revisado bajo control editorial humano.

Nuestra redacción
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
¿Te ha resultado útil este artículo?

30 personas han valorado este artículo

Me gusta
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
Compartir:
Comentarios (4)

Inicia sesión para unirte a la conversación.

HistoryBuff 15 Jul 2026 · 09:07

Comment ça marche avec plusieurs APIs ?

Dr. J. 15 Jul 2026 · 08:27

Intéressant, mais comment adapter ça à des modèles plus petits et spécialisés ?

GreenThumb 15 Jul 2026 · 10:42

Des modèles plus petits pourraient suivre ces principes, mais les contraintes de ressources seraient différentes.

TravelTom 15 Jul 2026 · 08:17

Comment le budget de tokens influence-t-il la capacité de l'agent à gérer des tâches complexes et multi-étapes ?

CriticAtHeart 15 Jul 2026 · 07:59

Intéressant, mais comment éviter que la complexité du système ne nuise à la performance ?

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secciones
Explorar
Información