Build 23/07/2026 à 18h396Ajouter aux favoris

Agent Swarm publishes the cleanest production measurement to date: Code Mode delivers a model-invariant ~99.2% dollar cost reduction versus the classic tool loop. Cloudflare (99.9% token cut) and Anthropic (98.7% on Drive→Salesforce) had promised it; it's now reproduced on real workload.
In plain terms. Instead of letting an agent guess which tool to call, turn after turn, you hand it a typed SDK and let it write a short script that orchestrates the calls. Result: ~99% fewer tokens, sensibly lower latency, and a bill that literally drops from $2 to $0.02 on a mid-size workflow.
Agent Swarm vient de publier la mesure la plus nette à ce jour : « 26 tool calls, one script, $0.02 ». Sur un pipeline production identique, le tool loop classique consomme ~1,17 M de tokens de contexte pour transporter les définitions d'outils et les retours ; Code Mode fait passer un SDK typé, laisse le modèle écrire un fragment TypeScript ou Python, et un sandbox V8 (chez Cloudflare) l'exécute. Le résultat n'est pas une projection : $0,02 mesurés, sur un modèle d'appel qui coûtait $2+ en tool loop.
Le chiffre reproduit deux benchmarks antérieurs. Cloudflare a publié 99,9% de réduction de tokens (1 000 vs 1,17 M) sur son runtime Workers en avril 2026. Anthropic a chiffré 98,7% sur le scénario Drive→Salesforce (150 000 → 2 000 tokens). Les trois expériences convergent à ~2 ordres de grandeur - indépendamment du modèle, puisque c'est le contexte qui explose ou pas : la réduction en dollars est model-invariante. Bonus : latence -30 à -40% (aller-retours d'agent supprimés).
Under the hood. Le pattern remplace la boucle « décrire tous les outils → choisir un outil → renvoyer résultat → recommencer » par deux primitives : search(query) (trouver un outil ou une entité) et execute(script) (exécuter du code qui coordonne les appels). Le SDK typé compte plus que la primitive : c'est lui qui donne au modèle la surface d'API sans devoir la re-décrire à chaque tour. Sandbox obligatoire (V8 isolé chez Cloudflare, variantes verrouillées type Starlark ailleurs) - c'est du code arbitraire qui s'exécute côté gateway.
Limites que la mesure ne cache pas : les workflows ultra-simples (1-2 tool calls) ne bénéficient pas - le fixe du prompt SDK domine. Le sandbox coûte à faire tourner (isolate, quota, kill switch). Les échecs sont plus corrélés : un script fautif casse tout le pipeline, là où un tool loop peut se rattraper par étape.
So what. Le tool loop tel qu'on l'a codé en 2024-2025 n'a plus de raison d'être pour tout workflow non-trivial. Les orchestrateurs (LangGraph et concurrents) vont devoir supporter le pattern ou disparaître de la comparaison prix. Pour les équipes qui font tourner des agents en prod : mesurez votre ratio tokens/mission sur un mois - si vous êtes à 100k+ tokens par mission, la migration se rembourse en semaine. La plomberie MCP a trouvé sa killer app.
Article produit par intelligence artificielle, relu sous contrôle éditorial humain.
Connectez-vous pour rejoindre la discussion.
Interesting stats! How does this cost reduction impact the speed of tool execution? Faster or same as before?
I'm curious about the environmental impact of such a drastic cost reduction. Does it also mean less energy consumption?
I wonder how this cost reduction affects the quality of the output. Is there a noticeable difference in the results compared to the classic tool loop?
Wow, a 99.2% cost reduction is impressive! Curious to see how this scales for larger projects.
This is a game-changer. I'm curious about the long-term sustainability of such a drastic cost reduction.
99.2% cost reduction is impressive, but I wonder about the trade-offs in performance or flexibility.
MCP : la plomberie des agents devient un vrai marché