ByteDance's SeedRealtime führt gleichzeitig Audio und Video im Vollduplex-Modus aus

Fortlaufende Berichterstattung : Course aux modèles vidéo génératifs : long-narrative, prix, contrôlabilité· Teil 2/2

Modelle & Werkzeuge 59 min ago5Zu Lesezeichen hinzufügen

ByteDance's SeedRealtime führt gleichzeitig Audio und Video im Vollduplex-Modus aus
Illustration : Léa Fontaine

ByteDance startete SeedRealtime, ein Vollduplex-Audio-Video-Modell für Echtzeit-KI-Interaktion. Im Gegensatz zu Seedance (Generierung von Langform-Videos) handelt es sich hier um eine konversationelle KI, die gleichzeitig zuhört und spricht – mit Live-Videoeingabe.

In einfachen Worten: ByteDance hat ein KI-Modell veröffentlicht, das Audio- und Videoeingaben und -ausgaben gleichzeitig verarbeitet, ohne zwischen Hör- und Sprechmodi zu wechseln. Es ist die Architektur, die Echtzeitgespräche tatsächlich erfordern.

Die Fakten

ByteDance hat laut Tech in Asia SeedRealtime gestartet, ein vollduplexfähiges audio-visuelles Modell für Echtzeit-KI-Interaktion. Vollduplex bedeutet gleichzeitiges bidirektionales Streaming: Eingabe- und Ausgabedaten von Audio und Video laufen parallel ab, statt sich abzuwechseln. Dies unterscheidet sich von Seedance (ByteDances Modell für langformatige Videogenerierung) – SeedRealtime zielt auf Gesprächs- und Live-Interaktionsanwendungen ab.

Unsere Einschätzung

Vollduplex ist die schwierige Aufgabe. Die meisten Sprach-KI-Systeme sind halbduplex: Sie nehmen Eingaben entgegen, generieren eine Antwort und wechseln dann zurück zum Zuhören. Die Latenz und die unangenehmen Unterbrechungen bei aktuellen Sprachassistenten resultieren direkt aus dieser Architektur. SeedRealtime betritt einen Bereich, in dem OpenAI (GPT-4o Advanced Voice), Google (Gemini Live) und ElevenLabs frühe Positionen besetzt haben – fügt jedoch multimodale Videoeingaben hinzu, die diese in Echtzeit nativ nicht unterstützen. Die kommerziellen Anwendungsfälle sind klar: Live-Übersetzung, Echtzeit-Kundenservice, KI-Begleit-Apps. Das Wettbewerbszeichen ist deutlicher: ByteDance gibt die Echtzeit-Multimodalität nicht an US-Labore ab.

Worauf zu achten ist

Latenz-Benchmarks und API-Preise im großen Maßstab. Vollduplex ist in einer Demo umsetzbar; es günstig in gleichzeitigen Sitzungen auf Produktionsniveau zu halten, ist die eigentliche technische Herausforderung.

Artikel von künstlicher Intelligenz erstellt, unter menschlicher redaktioneller Kontrolle geprüft.

Unsere Redaktion
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
War dieser Artikel hilfreich?

5 Personen gefiel dieser Artikel

Gefällt mir
P
Priya RamanML-Ingenieur
🇩🇪 ML-Ingenieur, angewandte Forschung.
Teilen:
Kommentare (5)

Melden Sie sich an, um an der Diskussion teilzunehmen.

TechSavvy47 05 Aug 2026 · 13:05

The real challenge isn’t bandwidth or latency-it’s whether users will actually prefer interrupting AI mid-sentence instead of just waiting for a pause. Humans adapt quickly to turn-taking, but machines?

Dr. Emily 05 Aug 2026 · 12:42

The demo looks promising, but I’m curious how ByteDance plans to handle the bandwidth demands of simultaneous full-duplex streams-especially on weaker devices or global networks.

J.P.R. 05 Aug 2026 · 15:05

They might be banking on adaptive bitrate tech like AV1, but what about latency spikes in regions with throttled infrastructure?

Critique42 05 Aug 2026 · 12:25

Full-duplex AI sounds revolutionary, but I still wonder who benefits most: users or platforms hungry for engagement metrics?

J.P.R. 2 05 Aug 2026 · 12:20

Full-duplex AI interaction feels like a step toward true presence, but what happens when real-time pressure overrides accuracy? Overfitting on latency might sacrifice nuance.

curio_usa 05 Aug 2026 · 12:18

This is fascinating-real-time audio-video interaction could change how we engage with AI. But I wonder about the latency issues in practical applications.

Chronologie des Themas

Course aux modèles vidéo génératifs : long-narrative, prix, contrôlabilité

  1. 1Seedance 2.5: ByteDance dehnt die generative Videoerstellung auf 30 Sekunden in einem einzigen Take02/08/2026
  2. 2ByteDance's SeedRealtime führt gleichzeitig Audio und Video im Vollduplex-Modus aus05/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Themen
Erkunden
Informationen