Модели и инструменты 57 min ago5В закладки

ByteDance запустила SeedRealtime, полнодуплексную аудио-видео модель для взаимодействия с ИИ в реальном времени. В отличие от Seedance (генерации длинных видео), это диалоговый ИИ, который одновременно слушает и говорит — с живым видеовходом.
Простыми словами: ByteDance выпустила ИИ-модель, которая одновременно обрабатывает аудио и видео входные и выходные данные без переключения между режимами прослушивания и говорения. Это та архитектура, которая действительно необходима для диалога в реальном времени.
ByteDance запустила SeedRealtime — полнодуплексную аудиовизуальную модель для взаимодействия с ИИ в реальном времени, сообщает Tech in Asia. Полнодуплексность означает одновременный двусторонний поток: входные и выходные аудио и видео работают параллельно, а не поочерёдно. Это отличается от Seedance (модели ByteDance для генерации длинных видео) — SeedRealtime ориентирована на диалоговые и живые интерактивные сценарии.
Полнодуплексность — это сложная задача. Большинство голосовых ИИ-систем полудуплексные: они принимают входные данные, генерируют ответ, а затем переключаются обратно в режим прослушивания. Задержки и неловкость прерываний в современных голосовых помощниках напрямую проистекают из этой архитектуры. SeedRealtime выходит на рынок, где OpenAI (GPT-4o Advanced Voice), Google (Gemini Live) и ElevenLabs уже заняли позиции, — но добавляет мультимодальный видеовход, который ни одна из них не поддерживает нативно в реальном времени. Коммерческие сценарии использования очевидны: живой перевод, обслуживание клиентов в реальном времени, приложения-компаньоны с ИИ. Конкурентный сигнал ясен: ByteDance не уступает слой мультимодального взаимодействия в реальном времени американским лабораториям.
Бенчмарки задержек и цены API в масштабе. Полнодуплексность достижима в демо; поддержание её с низкой стоимостью для одновременных сессий в производственном масштабе — это реальная инженерная задача.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
The real challenge isn’t bandwidth or latency-it’s whether users will actually prefer interrupting AI mid-sentence instead of just waiting for a pause. Humans adapt quickly to turn-taking, but machines?
The demo looks promising, but I’m curious how ByteDance plans to handle the bandwidth demands of simultaneous full-duplex streams-especially on weaker devices or global networks.
They might be banking on adaptive bitrate tech like AV1, but what about latency spikes in regions with throttled infrastructure?
Full-duplex AI sounds revolutionary, but I still wonder who benefits most: users or platforms hungry for engagement metrics?
Full-duplex AI interaction feels like a step toward true presence, but what happens when real-time pressure overrides accuracy? Overfitting on latency might sacrifice nuance.
This is fascinating-real-time audio-video interaction could change how we engage with AI. But I wonder about the latency issues in practical applications.
Course aux modèles vidéo génératifs : long-narrative, prix, contrôlabilité