ByteDance's SeedRealtime поддерживает полнодуплексный аудио- и видеопоток — одновременно.

Продолжение истории : Course aux modèles vidéo génératifs : long-narrative, prix, contrôlabilité· Часть 2/2

Модели и инструменты 57 min ago5В закладки

ByteDance's SeedRealtime поддерживает полнодуплексный аудио- и видеопоток — одновременно.
Иллюстрация : Léa Fontaine

ByteDance запустила SeedRealtime, полнодуплексную аудио-видео модель для взаимодействия с ИИ в реальном времени. В отличие от Seedance (генерации длинных видео), это диалоговый ИИ, который одновременно слушает и говорит — с живым видеовходом.

Простыми словами: ByteDance выпустила ИИ-модель, которая одновременно обрабатывает аудио и видео входные и выходные данные без переключения между режимами прослушивания и говорения. Это та архитектура, которая действительно необходима для диалога в реальном времени.

Факт

ByteDance запустила SeedRealtime — полнодуплексную аудиовизуальную модель для взаимодействия с ИИ в реальном времени, сообщает Tech in Asia. Полнодуплексность означает одновременный двусторонний поток: входные и выходные аудио и видео работают параллельно, а не поочерёдно. Это отличается от Seedance (модели ByteDance для генерации длинных видео) — SeedRealtime ориентирована на диалоговые и живые интерактивные сценарии.

Наша оценка

Полнодуплексность — это сложная задача. Большинство голосовых ИИ-систем полудуплексные: они принимают входные данные, генерируют ответ, а затем переключаются обратно в режим прослушивания. Задержки и неловкость прерываний в современных голосовых помощниках напрямую проистекают из этой архитектуры. SeedRealtime выходит на рынок, где OpenAI (GPT-4o Advanced Voice), Google (Gemini Live) и ElevenLabs уже заняли позиции, — но добавляет мультимодальный видеовход, который ни одна из них не поддерживает нативно в реальном времени. Коммерческие сценарии использования очевидны: живой перевод, обслуживание клиентов в реальном времени, приложения-компаньоны с ИИ. Конкурентный сигнал ясен: ByteDance не уступает слой мультимодального взаимодействия в реальном времени американским лабораториям.

На что обратить внимание

Бенчмарки задержек и цены API в масштабе. Полнодуплексность достижима в демо; поддержание её с низкой стоимостью для одновременных сессий в производственном масштабе — это реальная инженерная задача.

Статья создана искусственным интеллектом и проверена под редакционным контролем человека.

Наша редакция
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Была ли статья полезной?

5 чел. оценили эту статью

Нравится
P
Priya RamanMachine Learning Engineer
🇬🇧 ML engineer, applied research.
Поделиться:
Комментарии (5)

Войдите, чтобы участвовать в обсуждении.

TechSavvy47 05 Aug 2026 · 13:05

The real challenge isn’t bandwidth or latency-it’s whether users will actually prefer interrupting AI mid-sentence instead of just waiting for a pause. Humans adapt quickly to turn-taking, but machines?

Dr. Emily 05 Aug 2026 · 12:42

The demo looks promising, but I’m curious how ByteDance plans to handle the bandwidth demands of simultaneous full-duplex streams-especially on weaker devices or global networks.

J.P.R. 05 Aug 2026 · 15:05

They might be banking on adaptive bitrate tech like AV1, but what about latency spikes in regions with throttled infrastructure?

Critique42 05 Aug 2026 · 12:25

Full-duplex AI sounds revolutionary, but I still wonder who benefits most: users or platforms hungry for engagement metrics?

J.P.R. 2 05 Aug 2026 · 12:20

Full-duplex AI interaction feels like a step toward true presence, but what happens when real-time pressure overrides accuracy? Overfitting on latency might sacrifice nuance.

curio_usa 05 Aug 2026 · 12:18

This is fascinating-real-time audio-video interaction could change how we engage with AI. But I wonder about the latency issues in practical applications.

Хронология истории

Course aux modèles vidéo génératifs : long-narrative, prix, contrôlabilité

  1. 1Seedance 2.5: ByteDance расширяет возможности генерации видео до 30 секунд в одном кадре02/08/2026
  2. 2ByteDance's SeedRealtime поддерживает полнодуплексный аудио- и видеопоток — одновременно.05/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Темы
Обзор
Информация