QCon AI Boston: « prompts → platforms, harnesses, evals » - das Terrain bestätigt die These

Fortlaufende Berichterstattung : Harness Ops : post-mortems et bench des agents en prod· Teil 8/17

Handwerk Jul 17, 2026 at 14:197Zu Lesezeichen hinzufügen

QCon AI Boston: « prompts → platforms, harnesses, evals » - das Terrain bestätigt die These
Illustration : Léa Fontaine

Die Konferenz QCon AI Boston erfasst den Wendepunkt: Die KI-Produktion ist von einer Angelegenheit von Prompts zu einer Angelegenheit von Plattformen, Harnesses und Bewertungen übergegangen. Eine Konvergenz, kein Hype.

In einfachen Worten

Die Zusammenfassung von InfoQ (17. Juli 2026) zur QCon AI Boston lässt sich in einem Satz zusammenfassen: Teams, die KI in die Produktion bringen, sprechen nicht mehr über Prompts. Sie sprechen über interne Plattformen, Harnesses (den Orchestrator, der den Agenten mit Tools, Speicher und Wiederholungen ausführt) und kontinuierliche Bewertungen. Es ist die zweite Welle - nicht mehr "es antwortet gut", sondern "es funktioniert um 3 Uhr morgens".

Kontext

Der Thread harness-ops (Post-Mortems Grok CLI, #1184; Token-Disziplin, #1135; Malykhin über Java 1.5, #1175; State of MCP Security 2026, #1054) hat denselben Wechsel auf Seiten der einzelnen Teams dokumentiert. QCon AI Boston formalisiert, was diese Post-Mortems jeweils für sich gesagt haben: Der Prompt ist nicht mehr der Arbeitsort. Er ist zu einer Eingabe in ein größeres System geworden, mit seiner eigenen Ops-Disziplin.

Was das bedeutet

Plattformen. Die Teams hören auf, ihren Agenten direkt zu schreiben. Sie bauen eine interne Schicht - Templates, Connector, Budgets, Observability - auf, über der jedes Fachteam seinen Fall anpasst. Es ist dieselbe Entwicklung wie beim internen Cloud 2015-2020: Zuerst der lokale Schmerz, dann die Plattform.

Harnesses. Der Orchestrator wird zum kritischen Artefakt - oft wichtiger als die Modellauswahl. Modellmigration ohne Neu schreiben der App (Anthropic liefert seine Anleitung, #1135), instrumentiertes Tool-Calling, idempotente Retries, Memory Scoping.

Bewertungen. Die Bewertung ist kein einmaliger Vorgang mehr vor dem Release. Es ist ein kontinuierlicher Pipeline: Golden Test-Sets, LLM-as-Judge in der Produktion, automatisch erfasste Regressionen. Der Release-Prozess ähnelt eher dem CI eines Backends als einer Produktdemo.

Under the hood

Das versteckte Signal ist organisatorischer Natur. Dort, wo Projekte scheitern, ist es fast nie mehr das Modell - es ist das Fehlen einer Release-Disziplin (Uber-Budgets erschöpft, Microsoft-Lizenzen gekappt, #1023). Dort, wo sie erfolgreich sind, entsteht eine neue Rolle, die man "Harness Engineer" nennen kann: mehr SRE als ML, mehr Produkt als Infrastruktur.

So what

Für einen CTO im Jahr 2026 ist die strategische Frage nicht mehr "welches Modell", sondern "welche interne Agentenplattform". Der Vendor Lock-in spielt sich auf dieser Ebene ab: Je mehr Ihr Harness Ihre Geschäftslogik trägt, desto mehr wird er zum Vermögenswert - und desto austauschbarer wird das zugrunde liegende Modell. Das ist die einzige gute Nachricht des Jahres für diejenigen, die die Abhängigkeit von Frontier fürchten.

Zu beachten: die ausgereiften Model Context Protocols (#1054), die Budget-Tools vor dem CFO (#1023) und die Strukturierung in dedizierte Plattformteams.

Resources

Artikel von künstlicher Intelligenz erstellt, unter menschlicher redaktioneller Kontrolle geprüft.

Unsere Redaktion
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
War dieser Artikel hilfreich?

16 Personen gefiel dieser Artikel

Gefällt mir
M
Mateo RossiSoftwarearchitekt
🇮🇹 Architekt, zwei Jahrzehnte Systeme in Produktion.
Teilen:
Kommentare (7)

Melden Sie sich an, um an der Diskussion teilzunehmen.

Dr. J. 17 Jul 2026 · 17:45

Interesting shift, but how will these platforms handle bias in AI models? Will they be transparent about their evaluation methods?

BookWorm88 17 Jul 2026 · 20:16

Great question! Transparency in evaluation methods is crucial, but it's also important to consider how these platforms will handle real-time bias mitigation.

EcoWarrior 17 Jul 2026 · 17:39

What about the environmental impact of these AI platforms? Who's measuring their carbon footprint and ensuring sustainability?

Emma_London 17 Jul 2026 · 17:34

I wonder how this shift will affect the accessibility of AI tools for those in developing countries with limited infrastructure.

J.P.R. 3 17 Jul 2026 · 10:07

I agree, but what about data privacy and security on these platforms? Who's accountable for leaks or misuse?

TechSavvy47 17 Jul 2026 · 09:59

This shift seems inevitable, but I wonder how much control users will have over the platforms and harnesses.

FoodieChicago 17 Jul 2026 · 09:56

This transition makes sense, but I'm curious about the learning curve for non-tech users. Will these platforms be accessible enough?

sandrine.b 17 Jul 2026 · 09:36

Interesting perspective. I wonder how this shift will impact smaller artists like me who rely on simple prompts.

Chronologie des Themas

Harness Ops : post-mortems et bench des agents en prod

  1. 1Migrating a production agent to GPT-5.6: 2.2× faster, 27% cheaper - the real post-mortem13/07/2026
  2. 233k vs 7k Tokens: Was die vergleichbaren Overheads von Claude Code und OpenCode offenbaren13/07/2026
  3. 3Google Genkit v.Agents: Detached Turns und Human-in-the-Loop kommen in die Vorschau14/07/2026
  4. 4Drei Schlaufen in einem Trenchcoat: Die wahre Anatomie eines Agenten14/07/2026
  5. 5« Loop engineering »: neue Disziplin oder nur ein neues Marketing für Cron-Jobs?15/07/2026
  6. 6Benchmark Stripe: Die Agenten verbinden die APIs, aber sie validieren sie nicht15/07/2026
  7. 7Der Archäologe und sein Copilot: Malykhin diszipliniert das LLM auf Java 1.516/07/2026
  8. 8QCon AI Boston: « prompts → platforms, harnesses, evals » - das Terrain bestätigt die These17/07/2026
  9. 9Über grep hinaus: Die These des kontextreichen KI-Code-Harness20/07/2026
  10. 10InAgent erreicht 90,2 % auf OSWorld: Die Lücke des Computer-Nutzungsagenten für den chinesischen Stack wird kleiner03/08/2026
  11. 11Wallfacer: ein Terminal-Sitzungsmanager, der für Claude Code und Multi-Agent-Workflows entwickelt wurde06/08/2026
  12. 12Claude-Code-Inter-Session-Nachrichtenversand – agentenübergreifende Koordination erhält ihre erste native Primitivfunktion08/08/2026
  13. 13KI-Agenten-Fähigkeiten werden standardisiert: Codex und VS Code sind dabei, Claude noch nicht.10/08/2026
  14. 14KI-Agenten lügen, betrügen und stehlen – und das bremst die Akzeptanz schneller, als es ein Benchmark messen kann.13/08/2026
  15. 15Kontext-Engineering: Warum 300 gut gewählte Tokens 100.000 verrauschte übertreffen14/08/2026
  16. 16OneCLI (YC S26) liefert eine Open-Source-Sandbox-Agenten-Harness – die teamskalierbare Antwort auf Claude Code19/08/2026
  17. 17Cursor Origin und das Agent-Versionkontrollproblem: Warum Git nie dafür entwickelt wurde25/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Themen
Erkunden
Informationen