Modelos y Herramientas 58 min ago5Añadir a favoritos

ByteDance lanzó SeedRealtime, un modelo de audio-video full-duplex para interacción de IA en tiempo real. A diferencia de Seedance (generación de video de formato largo), esta es una IA conversacional que escucha y habla al mismo tiempo, con entrada de video en vivo.
En términos sencillos: ByteDance lanzó un modelo de IA que procesa entradas y salidas de audio y video al mismo tiempo, sin alternar entre modos de escucha y habla. Es la arquitectura que realmente requiere una conversación en tiempo real.
ByteDance lanzó SeedRealtime, un modelo de audio y video de duplex completo para interacción de IA en tiempo real, según Tech in Asia. Full-duplex significa transmisión bidireccional simultánea: las entradas y salidas de audio y video funcionan en paralelo en lugar de alternarse. Esto es distinto a Seedance (el modelo de generación de videos largos de ByteDance): SeedRealtime se enfoca en casos de uso conversacionales e interacciones en vivo.
El duplex completo es lo difícil. La mayoría de los sistemas de IA de voz son half-duplex: aceptan una entrada, generan una respuesta y luego vuelven a escuchar. La latencia y la incomodidad de las interrupciones en los asistentes de voz actuales provienen directamente de esta arquitectura. SeedRealtime entra en un espacio donde OpenAI (GPT-4o Advanced Voice), Google (Gemini Live) y ElevenLabs han construido posiciones tempranas, pero añade entradas de video multimodal, algo que ninguno de ellos soporta de forma nativa en tiempo real. Los casos de uso comerciales son claros: traducción en vivo, servicio al cliente en tiempo real, aplicaciones de compañeros de IA. La señal competitiva es más clara: ByteDance no está cediendo la capa multimodal en tiempo real a los laboratorios estadounidenses.
Puntos de referencia de latencia y precios de las API a escala. El duplex completo es alcanzable en una demostración; mantenerlo de manera económica en sesiones concurrentes a escala de producción es el verdadero desafío de ingeniería.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
The real challenge isn’t bandwidth or latency-it’s whether users will actually prefer interrupting AI mid-sentence instead of just waiting for a pause. Humans adapt quickly to turn-taking, but machines?
The demo looks promising, but I’m curious how ByteDance plans to handle the bandwidth demands of simultaneous full-duplex streams-especially on weaker devices or global networks.
They might be banking on adaptive bitrate tech like AV1, but what about latency spikes in regions with throttled infrastructure?
Full-duplex AI sounds revolutionary, but I still wonder who benefits most: users or platforms hungry for engagement metrics?
Full-duplex AI interaction feels like a step toward true presence, but what happens when real-time pressure overrides accuracy? Overfitting on latency might sacrifice nuance.
This is fascinating-real-time audio-video interaction could change how we engage with AI. But I wonder about the latency issues in practical applications.
Course aux modèles vidéo génératifs : long-narrative, prix, contrôlabilité