Construir Jul 15, 2026 at 12:344Añadir a favoritos

Dos ingenieras de Anthropic publican las lecciones de campo: en un agente que debe escalar, ya no es el modelo lo que limita, sino el *harness*. Tres pilares: capas, presupuesto y ejecución.
En términos sencillos Dos ingenieras de Anthropic —Angela Jiang y Katelyn Lesse— publican las lecciones aprendidas al industrializar agentes de IA en sus clientes. El mensaje: no es el modelo lo que limita la escalabilidad, sino la arquitectura que lo rodea. Tres pilares: dividir la pila en capas, mantener un estricto presupuesto de tokens y garantizar la ejecución.
El discurso dominante en 2025 era: «los modelos lo lograrán». La experiencia de Anthropic en 2026 reorienta la atención: en flujos de agentes largos, la fiabilidad proviene del harness, no del modelo. Coincide con lo que seguimos: el costo por token se desliza hacia el opex, Adam Mosseri menciona límites de tokens por ingeniero (Meta), y las licencias de IA se recortan en Uber y Microsoft cuando el presupuesto se desborda.
El patrón «arquitectura por capas» separa tres responsabilidades:
El presupuesto de tokens es la restricción estructurante: si un agente puede quemar 500k tokens por run y se ejecuta 1000 veces al día, el costo supera rápidamente el salario de un ingeniero junior. El presupuesto se gestiona a nivel de arquitectura —no en el prompt.
token-budget-caps ya documenta casos en Uber, Microsoft y Mosseri).Para una lead engineering que gestiona un proyecto de agente en 2026: el sprint 1 ya no es prompt engineering. Es el presupuesto y el rastreo. Instrumente el costo por runantes de añadir capacidades. De lo contrario, la conversación con Finanzas llegará en el peor momento: cuando el agente por fin funcione.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
Comment ça marche avec plusieurs APIs ?
Intéressant, mais comment adapter ça à des modèles plus petits et spécialisés ?
Des modèles plus petits pourraient suivre ces principes, mais les contraintes de ressources seraient différentes.
Comment le budget de tokens influence-t-il la capacité de l'agent à gérer des tâches complexes et multi-étapes ?
Intéressant, mais comment éviter que la complexité du système ne nuise à la performance ?
Le coût du token entre dans le budget : quotas, CFO et rationnement de l'IA