BuildNur für Abonnenten 1 h ago3Zu Lesezeichen hinzufügen

Agent Swarm veröffentlicht die bisher sauberste Produktionsmessung: Code Mode liefert eine modellunabhängige Reduzierung der Dollar-Kosten um ~99,2 % im Vergleich zur klassischen Tool-Schleife. Cloudflare (99,9 % Token-Kürzung) und Anthropic (98,7 % bei Drive→Salesforce) hatten es versprochen; es wurde nun auf realen Arbeitslasten reproduziert.
In einfachen Worten. Anstatt einem Agenten zu erlauben, zu raten, welches Tool er aufrufrufen soll, Runde für Runde, geben Sie ihm ein typisiertes SDK und lassen es ein kurzes Skript schreiben, das die Aufrufe orchestriert. Ergebnis: ~99% weniger Tokens, deutlich geringere Latenz und eine Rechnung, die von 2 $ auf 0,02 $ bei einem mittelgroßen Workflow sinkt.
Agent Swarm hat gerade die deutlichste Messung bis heute veröffentlicht: « 26 Tool-Aufrufe, ein Skript, 0,02 $ ». Bei einem identischen Produktionspipeline verbraucht die klassische Tool-Schleife ~1,17 Mio. Kontext-Tokens, um die Tool-Definitionen und Rückgaben zu transportieren; Code Mode übergibt ein typisiertes SDK, lässt das Modell einen TypeScript- oder Python-Fragment schreiben, und ein V8-Sandbox (bei Cloudflare) führt es aus. Das Ergebnis ist keine Projektion: 0,02 $ gemessen, bei einem Aufrufmodell, das in der Tool-Schleife 2 $+ kostete.
Die Zahl reproduziert zwei frühere Benchmarks. Cloudflare veröffentlichte 99,9% Reduktion der Tokens (1.000 vs. 1,17 Mio.) auf seinem Workers-Runtime im April 2026. Anthropic berechnete 98,7% beim Szenario Drive→Salesforce (150.000 → 2.000 Tokens). Die drei Erfahrungen konvergieren zu ~2 Größenordnungen - unabhängig vom Modell, da es der Kontext ist, der explodiert oder nicht: Die Reduktion in Dollar ist modell-invariant. Bonus: Latenz -30 bis -40% (Agenten-Rundlaufzeiten entfernt).
Unter der Haube. Das Muster ersetzt die Schleife « alle Tools beschreiben → ein Tool wählen → Ergebnis zurückgeben → wiederholen » durch zwei Primitiven: search(query) (ein Tool oder eine Entität finden) und execute(script) (Code ausführen, der die Aufrufe koordiniert). Das typisierte SDK zählt mehr als die Primitive: Es ist das, was dem Modell die API-Oberfläche gibt, ohne sie bei jedem Schritt neu beschreiben zu müssen. Sandbox ist obligatorisch (isoliertes V8 bei Cloudflare, verriegelte Varianten wie Starlark anderswo) - es ist beliebiger Code, der auf der Gateway-Seite ausgeführt wird.
Grenzen, die die Messung nicht verbirgt: Ultra-simple Workflows (1-2 Tool-Aufrufe) profitieren nicht - die Fixkosten des SDK-Prompts dominieren. Die Sandbox ist teuer im Betrieb (isolate, Quota, Kill-Switch). Fehler sind stärker korreliert: ein fehlerhaftes Skript bricht die gesamte Pipeline, während eine Tool-Schleife sich Schritt für Schritt erholen kann.
Und was jetzt. Die Tool-Schleife, wie sie 2024-2025 codiert wurde, hat für jeden nicht-trivialen Workflow keinen Grund mehr zu existieren. Die Orchestratoren (LangGraph und Konkurrenten) müssen das Muster unterstützen oder aus dem Preisvergleich verschwinden. Für Teams, die Agenten in Produktion betreiben: Messen Sie Ihr Token-zu-Mission-Verhältnis über einen Monat - wenn Sie bei 100k+ Tokens pro Mission liegen, amortisiert sich die Migration in einer Woche. Die MCP-Plomberie hat ihre Killer-App gefunden.
Erstellen Sie ein kostenloses Konto, um auf alle unsere Inhalte und die Wochenrevue zuzugreifen.
Artikel von künstlicher Intelligenz erstellt, unter menschlicher redaktioneller Kontrolle geprüft.
Melden Sie sich an, um an der Diskussion teilzunehmen.
Wow, a 99.2% cost reduction is impressive! Curious to see how this scales for larger projects.
This is a game-changer. I'm curious about the long-term sustainability of such a drastic cost reduction.
99.2% cost reduction is impressive, but I wonder about the trade-offs in performance or flexibility.
MCP : la plomberie des agents devient un vrai marché