Wie OpenAI ChatGPT schnell hält, während agentisches Coding das Lastprofil neu schreibt

Fortlaufende Berichterstattung : OpenAI Super App : la bascule ChatGPT = Codex et l'agent-first· Teil 7/7

Bau just now0Zu Lesezeichen hinzufügen

Wie OpenAI ChatGPT schnell hält, während agentisches Coding das Lastprofil neu schreibt
Illustration : Léa Fontaine

Eine QCon-Leistungsoptimierungspräsentation von OpenAI zeigt die Infrastrukturentscheidungen hinter den Latenzzielen von ChatGPT – und wie die Verschiebung des Produkts von einem Chat- zu einem Agentenmodell jede Annahme verändert hat.

In einfachen Worten: Ein Vortrag von Martin Spier (OpenAI) über Performance-Engineering, veröffentlicht auf InfoQ, dokumentiert, wie sich die Infrastruktur von ChatGPT anpasste, als das Produkt von einfachen Chats zu agentischen Code-Workflows überging. Die Kurzfassung: Agentische Anfragen sehen nicht aus wie Chat-Anfragen, und alles, was für kurze Dialoge optimiert war, musste neu gedacht werden.

Die zentrale Herausforderung ist die Form der Anfrage. Agentische Code-Sitzungen sind länger, sie pausieren zwischendurch, während sie auf Tool-Aufrufe warten, und sie erzeugen unregelmäßige Lastmuster auf Inferenz-Backends, die für den Rhythmus von Gesprächen ausgelegt sind. Das Team reagierte mit adaptivem Streaming, spekulativem Caching und lastabhängiger Sitzungsverwaltung, die die erwartete Kontextlänge bereits bei der Anfrage berücksichtigt – nicht erst bei der Planung.

[Im Detail] Agentische Workflows erhöhen laut Spier die Menge an Code-Änderungen bei ChatGPTs Skalierung dramatisch. Die Latenzempfindlichkeit konzentriert sich an den Grenzen von Tool-Aufrufen statt auf die Generierungsgeschwindigkeit – was die Optimierungsprioritäten im Vergleich zur Chat-Ära umkehrt. Die Kaltstart-Latenz bei der Tool-Auflösung wird zum kritischen Pfad, nicht der Durchsatz bei der Token-Generierung.

Was bedeutet das: Die SLAs und Infrastruktur-Muster von ChatGPT aus 2023 gelten nicht für ChatGPT Work 2026. Teams, die auf OpenAI-APIs oder ähnlichen Plattformen aufbauen, müssen ihre Anfragemuster an agentische Lastprofile anpassen – unregelmäßige Lastverteilung, Kontextlängenverteilung und Tool-Aufruffrequenz – statt an durchschnittliche Chat-Latenz-Benchmarks.

Resources

Artikel von künstlicher Intelligenz erstellt, unter menschlicher redaktioneller Kontrolle geprüft.

Unsere Redaktion
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
War dieser Artikel hilfreich?

0 Personen gefiel dieser Artikel

Gefällt mir
A
Aiko NakamuraSenior-Softwareingenieurin
🇩🇪 Senior-Ingenieurin, Plattformen im großen Maßstab. Schreibt über den Bau mit KI.
Teilen:
Kommentare (0)

Melden Sie sich an, um an der Diskussion teilzunehmen.

Schreiben Sie den ersten Kommentar.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Themen
Erkunden
Informationen