← Últimos artículos
💻 computer science

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer es un marco de postentrenamiento que permite la transmisión de texto a audio y video de larga duración en tiempo real mediante la combinación de un generador causal entrenado con estrategias de forzado mixto, destilación DMD para la estabilidad de largo horizonte y un modelo de lenguaje externo para la planificación del habla con el fin de lograr una generación de avatar de alta velocidad, sincronizada y consistente.

Autores originales: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

Publicado 2026-08-07
📖 3 min de lectura☕ Lectura para el café

Autores originales: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a contar una historia. Quieres que hable, mueva los labios y cambie sus expresiones faciales, todo al mismo tiempo, tal como lo hace una persona real. Durante mucho tiempo, los mejores robots solo podían hacer esto para clips muy cortos, como un saludo de 5 segundos. Trabajaban como un director que observa todo el guion antes de filmar una escena, mirando hacia adelante para ver qué sucede después. Pero en el mundo real, no tenemos tiempo para esperar a que toda la historia esté escrita antes de empezar a hablar. Necesitamos que el robot hable ahora, basándose únicamente en lo que ha dicho hasta el momento, mientras mantiene su rostro y su voz perfectamente sincronizados. Este es el desafío del "streaming en tiempo real". El problema es que, si un robot comete un pequeño error en el primer segundo, ese error puede acumularse con el tiempo, haciendo que el rostro del robot se vea extraño o que su voz se desvíe del tema hacia el final de la conversación. Los científicos han estado tratando de descubrir cómo hacer que estos avatares digitales hablen durante minutos enteros sin perder la cabeza o el ritmo.

Entra en escena Vorch-Streamer, un nuevo sistema que actúa como un narrador de tiempo real súper organizado. En lugar de intentar memorizar todo el guion antes de hablar, Vorch-Streamer utiliza una ingeniosa estrategia de dos partes para mantener el espectáculo en marcha durante más de dos minutos sin detenerse. Piensa en ello como una banda tocando una larga sesión de improvisación. Normalmente, si un músico toca una nota falsa, el resto de la canción podría volverse desordenada. Pero Vorch-Streamer tiene un modo especial de "ensayo". Primero, practica tocando segmentos cortos mientras es corregido suavemente por un profesor (un modelo preentrenado que sabe cómo hacerlo perfectamente). Luego, practica tocando toda la canción de principio a fin, pero esta vez, escucha sus propios errores previos y aprende cómo corregirlos sobre la marcha, todo mientras un "director de orquesta" (un planificador de IA) le dice exactamente qué palabras decir a continuación.

El resultado es un avatar digital capaz de generar video y audio simultáneamente a 27.12 fotogramas por segundo (FPS). Para ponerlo en perspectiva, el video estándar se reproduce a 24 FPS, lo que significa que este robot es en realidad más rápido que el tiempo real. Puede mantener su rostro pareciendo la misma persona, sus labios moviéndose en perfecto tiempo con sus palabras y su voz clara y precisa durante casi dos minutos seguidos. Los investigadores descubrieron que sin un paso específico de "planificación" para decidir qué decir a continuación, el robot se confundiría y empezaría a decir disparates o a repetirse. Al añadir este planificador, el sistema resuelve con éxito el rompecabezas de cómo mantener una conversación larga fluyendo suavemente sin necesidad de ver el futuro. Demuestra que puedes tomar a un robot poderoso y lento que lo sabe todo sobre una historia y convertirlo en un intérprete rápido y en vivo que sabe lo justo para mantener el espectáculo en marcha, segundo a segundo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →