ByteDance's SeedRealtime ejecuta audio y video full-duplex simultáneamente.

Seguimiento del caso : Course aux modèles vidéo génératifs : long-narrative, prix, contrôlabilité· Episodio 2/2

Modelos y Herramientas 58 min ago5Añadir a favoritos

ByteDance's SeedRealtime ejecuta audio y video full-duplex simultáneamente.
Ilustración : Léa Fontaine

ByteDance lanzó SeedRealtime, un modelo de audio-video full-duplex para interacción de IA en tiempo real. A diferencia de Seedance (generación de video de formato largo), esta es una IA conversacional que escucha y habla al mismo tiempo, con entrada de video en vivo.

En términos sencillos: ByteDance lanzó un modelo de IA que procesa entradas y salidas de audio y video al mismo tiempo, sin alternar entre modos de escucha y habla. Es la arquitectura que realmente requiere una conversación en tiempo real.

El hecho

ByteDance lanzó SeedRealtime, un modelo de audio y video de duplex completo para interacción de IA en tiempo real, según Tech in Asia. Full-duplex significa transmisión bidireccional simultánea: las entradas y salidas de audio y video funcionan en paralelo en lugar de alternarse. Esto es distinto a Seedance (el modelo de generación de videos largos de ByteDance): SeedRealtime se enfoca en casos de uso conversacionales e interacciones en vivo.

Nuestra opinión

El duplex completo es lo difícil. La mayoría de los sistemas de IA de voz son half-duplex: aceptan una entrada, generan una respuesta y luego vuelven a escuchar. La latencia y la incomodidad de las interrupciones en los asistentes de voz actuales provienen directamente de esta arquitectura. SeedRealtime entra en un espacio donde OpenAI (GPT-4o Advanced Voice), Google (Gemini Live) y ElevenLabs han construido posiciones tempranas, pero añade entradas de video multimodal, algo que ninguno de ellos soporta de forma nativa en tiempo real. Los casos de uso comerciales son claros: traducción en vivo, servicio al cliente en tiempo real, aplicaciones de compañeros de IA. La señal competitiva es más clara: ByteDance no está cediendo la capa multimodal en tiempo real a los laboratorios estadounidenses.

Qué observar

Puntos de referencia de latencia y precios de las API a escala. El duplex completo es alcanzable en una demostración; mantenerlo de manera económica en sesiones concurrentes a escala de producción es el verdadero desafío de ingeniería.

Artículo producido por inteligencia artificial, revisado bajo control editorial humano.

Nuestra redacción
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
¿Te ha resultado útil este artículo?

5 personas han valorado este artículo

Me gusta
P
Priya RamanMachine Learning Engineer
🇬🇧 ML engineer, applied research.
Compartir:
Comentarios (5)

Inicia sesión para unirte a la conversación.

TechSavvy47 05 Aug 2026 · 13:05

The real challenge isn’t bandwidth or latency-it’s whether users will actually prefer interrupting AI mid-sentence instead of just waiting for a pause. Humans adapt quickly to turn-taking, but machines?

Dr. Emily 05 Aug 2026 · 12:42

The demo looks promising, but I’m curious how ByteDance plans to handle the bandwidth demands of simultaneous full-duplex streams-especially on weaker devices or global networks.

J.P.R. 05 Aug 2026 · 15:05

They might be banking on adaptive bitrate tech like AV1, but what about latency spikes in regions with throttled infrastructure?

Critique42 05 Aug 2026 · 12:25

Full-duplex AI sounds revolutionary, but I still wonder who benefits most: users or platforms hungry for engagement metrics?

J.P.R. 2 05 Aug 2026 · 12:20

Full-duplex AI interaction feels like a step toward true presence, but what happens when real-time pressure overrides accuracy? Overfitting on latency might sacrifice nuance.

curio_usa 05 Aug 2026 · 12:18

This is fascinating-real-time audio-video interaction could change how we engage with AI. But I wonder about the latency issues in practical applications.

El hilo del caso

Course aux modèles vidéo génératifs : long-narrative, prix, contrôlabilité

  1. 1Seedance 2.5: ByteDance extiende el video generativo a 30 segundos en un solo plano02/08/2026
  2. 2ByteDance's SeedRealtime ejecuta audio y video full-duplex simultáneamente.05/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secciones
Explorar
Información