Modo de código en producción: "26 llamadas a herramientas, un script, $0.02" marca el fin del bucle de herramientas

Seguimiento del caso : MCP : la plomberie des agents devient un vrai marché· Episodio 4/7

Construir Jul 23, 2026 at 18:396Añadir a favoritos

Modo de código en producción: "26 llamadas a herramientas, un script, $0.02" marca el fin del bucle de herramientas
Ilustración : Léa Fontaine

Agent Swarm publica la medición de producción más limpia hasta la fecha: Code Mode logra una reducción de costos en dólares de aproximadamente **~99.2%** invariante al modelo en comparación con el bucle clásico de herramientas. Cloudflare (**reducción del 99.9% en tokens**) y Anthropic (**98.7% en Drive→Salesforce**) lo habían prometido; ahora se reproduce en carga de trabajo real.

En términos sencillos. En lugar de dejar que un agente adivine qué herramienta llamar, turno tras turno, le proporcionas un SDK tipado y le permites escribir un breve script que orqueste las llamadas. Resultado: ~99% menos tokens, latencia sensiblemente menor y una factura que literalmente baja de $2 a $0.02 en un flujo de trabajo de tamaño medio.

Agent Swarm acaba de publicar la medición más clara hasta la fecha: «26 llamadas a herramientas, un script, $0.02». En un pipeline de producción idéntico, el bucle clásico de herramientas consume ~1,17 M de tokens de contexto para transportar las definiciones de herramientas y los retornos; Code Mode hace pasar un SDK tipado, deja que el modelo escriba un fragmento de TypeScript o Python, y un sandbox V8 (en Cloudflare) lo ejecuta. El resultado no es una proyección: $0,02 medidos, en un modelo de llamada que costaba $2+ en el bucle de herramientas.

La cifra reproduce dos benchmarks anteriores. Cloudflare publicó una reducción del 99,9% de tokens (1 000 vs 1,17 M) en su runtime Workers en abril de 2026. Anthropic cuantificó un 98,7% en el escenario Drive→Salesforce (150 000 → 2 000 tokens). Las tres experiencias convergen en ~2 órdenes de magnitud —independientemente del modelo, ya que es el contexto el que explota o no: la reducción en dólares es invariante al modelo. Bonus: latencia -30 a -40% (eliminados los viajes de ida y vuelta del agente).

Bajo el capó. El patrón reemplaza el bucle «describir todas las herramientas → elegir una herramienta → devolver resultado → repetir» por dos primitivas: search(query) (encontrar una herramienta o entidad) y execute(script) (ejecutar código que coordina las llamadas). El SDK tipado importa más que la primitiva: es él quien le da al modelo la superficie de API sin tener que describirla en cada turno. El sandbox es obligatorio (V8 aislado en Cloudflare, variantes bloqueadas como Starlark en otros lugares) —es código arbitrario que se ejecuta en el gateway.

Límites que la medición no oculta: los flujos de trabajo ultra-simples (1-2 llamadas a herramientas) no se benefician —el fijo del prompt del SDK domina. El sandbox tiene un coste de ejecución (isolate, cuota, kill switch). Los fallos están más correlacionados: un script defectuoso rompe todo el pipeline, mientras que un bucle de herramientas puede recuperarse por etapas.

Entonces, ¿qué? El bucle de herramientas tal como lo codificamos en 2024-2025 ya no tiene razón de ser para ningún flujo de trabajo no trivial. Los orquestadores (LangGraph y competidores) tendrán que soportar este patrón o desaparecer de la comparación de precios. Para los equipos que ejecutan agentes en producción: midan su ratio tokens/misión en un mes —si están en 100k+ tokens por misión, la migración se amortiza en semanas. La plomería MCP ha encontrado su killer app.

Resources

Artículo producido por inteligencia artificial, revisado bajo control editorial humano.

Nuestra redacción
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
¿Te ha resultado útil este artículo?

6 personas han valorado este artículo

Me gusta
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
Compartir:
Comentarios (6)

Inicia sesión para unirte a la conversación.

HistoryBuff 24 Jul 2026 · 07:39

Interesting stats! How does this cost reduction impact the speed of tool execution? Faster or same as before?

GreenThumb 24 Jul 2026 · 07:28

I'm curious about the environmental impact of such a drastic cost reduction. Does it also mean less energy consumption?

1
ArtLover99 24 Jul 2026 · 06:48

I wonder how this cost reduction affects the quality of the output. Is there a noticeable difference in the results compared to the classic tool loop?

Dr. Emily 23 Jul 2026 · 14:40

Wow, a 99.2% cost reduction is impressive! Curious to see how this scales for larger projects.

FilmBuffNYC 23 Jul 2026 · 14:39

This is a game-changer. I'm curious about the long-term sustainability of such a drastic cost reduction.

FoodieChicago 23 Jul 2026 · 14:27

99.2% cost reduction is impressive, but I wonder about the trade-offs in performance or flexibility.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secciones
Explorar
Información