BuildRéservé aux abonnés il y a 35 min3Ajouter aux favoris

Agent Swarm publishes the cleanest production measurement to date: Code Mode delivers a model-invariant ~99.2% dollar cost reduction versus the classic tool loop. Cloudflare (99.9% token cut) and Anthropic (98.7% on Drive→Salesforce) had promised it; it's now reproduced on real workload.
In plain terms. Instead of letting an agent guess which tool to call, turn after turn, you hand it a typed SDK and let it write a short script that orchestrates the calls. Result: ~99% fewer tokens, sensibly lower latency, and a bill that literally drops from $2 to $0.02 on a mid-size workflow.
Agent Swarm vient de publier la mesure la plus nette à ce jour : « 26 tool calls, one script, $0.02 ». Sur un pipeline production identique, le tool loop classique consomme ~1,17 M de tokens de contexte pour transporter les définitions d'outils et les retours ; Code Mode fait passer un SDK typé, laisse le modèle écrire un fragment TypeScript ou Python, et un sandbox V8 (chez Cloudflare) l'exécute. Le résultat n'est pas une projection : $0,02 mesurés, sur un modèle d'appel qui coûtait $2+ en tool loop.
Le chiffre reproduit deux benchmarks antérieurs. Cloudflare a publié 99,9% de réduction de tokens (1 000 vs 1,17 M) sur son runtime Workers en avril 2026. Anthropic a chiffré 98,7% sur le scénario Drive→Salesforce (150 000 → 2 000 tokens). Les trois expériences convergent à ~2 ordres de grandeur - indépendamment du modèle, puisque c'est le contexte qui explose ou pas : la réduction en dollars est model-invariante. Bonus : latence -30 à -40% (aller-retours d'agent supprimés).
Under the hood. Le pattern remplace la boucle « décrire tous les outils → choisir un outil → renvoyer résultat → recommencer » par deux primitives : search(query) (trouver un outil ou une entité) et execute(script) (exécuter du code qui coordonne les appels). Le SDK typé compte plus que la primitive : c'est lui qui donne au modèle la surface d'API sans devoir la re-décrire à chaque tour. Sandbox obligatoire (V8 isolé chez Cloudflare, variantes verrouillées type Starlark ailleurs) - c'est du code arbitraire qui s'exécute côté gateway.
Limites que la mesure ne cache pas : les workflows ultra-simples (1-2 tool calls) ne bénéficient pas - le fixe du prompt SDK domine. Le sandbox coûte à faire tourner (isolate, quota, kill switch). Les échecs sont plus corrélés : un script fautif casse tout le pipeline, là où un tool loop peut se rattraper par étape.
So what. Le tool loop tel qu'on l'a codé en 2024-2025 n'a plus de raison d'être pour tout workflow non-trivial. Les orchestrateurs (LangGraph et concurrents) vont devoir supporter le pattern ou disparaître de la comparaison prix. Pour les équipes qui font tourner des agents en prod : mesurez votre ratio tokens/mission sur un mois - si vous êtes à 100k+ tokens par mission, la migration se rembourse en semaine. La plomberie MCP a trouvé sa killer app.
Créez un compte gratuit pour accéder à l'intégralité de nos contenus et à la revue hebdomadaire.
Article produit par intelligence artificielle, relu sous contrôle éditorial humain.
Connectez-vous pour rejoindre la discussion.
Wow, a 99.2% cost reduction is impressive! Curious to see how this scales for larger projects.
This is a game-changer. I'm curious about the long-term sustainability of such a drastic cost reduction.
99.2% cost reduction is impressive, but I wonder about the trade-offs in performance or flexibility.
MCP : la plomberie des agents devient un vrai marché