Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
Este artículo presenta Live Avatar, un marco de trabajo de algoritmo-sistema co-diseñado que permite la primera generación de streaming práctica, en tiempo real e de longitud infinita de avatares de 14 mil millones de parámetros impulsados por audio, combinando un pipeline de difusión causal destilado con Paralelismo de Pipeline forzado por Timestep para lograr 45 FPS al eliminar la deriva de identidad en horizontes largos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando enseñarle a un robot a contar una historia. Quieres que hable, mueva los labios y cambie sus expresiones faciales en perfecta sincronía con tu voz, todo mientras parece un humano real. Este es el mundo de la generación de avatares impulsados por audio. Durante mucho tiempo, los científicos han estado construyendo "actores digitales" utilizando un tipo de IA llamada modelo de difusión. Piensa en un modelo de difusión como un escultor que comienza con un bloque de estática ruidosa y va eliminando lentamente el ruido para revelar una estatua perfecta. Normalmente, este escultor trabaja en un orden muy estricto: debe terminar la cabeza antes de poder empezar el cuerpo, y tiene que hacerlo paso a paso, lo cual toma mucho tiempo.
El gran problema es que, si le pides a este robot que cuente una historia durante una hora, tiende a confundirse. Podría olvidar cómo era la cara del personaje hace cinco minutos, o su voz podría empezar a sonar como una persona completamente distinta. Esto se llama "deriva" (drift). Además, debido a que el escultor trabaja muy lentamente, no puedes tener una conversación en tiempo real con él; para cuando termina una frase, ya has olvidado lo que dijiste. El objetivo de los investigadores ha sido construir un actor digital que sea lo suficientemente rápido como para hablar contigo en vivo, lo suficientemente inteligente como para mantener su identidad durante horas y lo suficientemente detallado como para ser fotorealista.
Entra en escena Live Avatar, un nuevo proyecto que actúa como un director de orquesta maestro para una enorme orquesta de chips informáticos. Los investigadores detrás de este trabajo, liderados por equipos de la Universidad de Ciencia y Tecnología de China y Alibaba, han descubierto cómo hacer que un modelo de IA gigante de 14 mil millones de parámetros (un modelo "14B", que es enorme en el mundo de la IA) hable, se mueva y transmita video en tiempo real sin perder la cabeza.
Normalmente, hacer un video así de largo y de esta velocidad es una contradicción. Puedes tener velocidad o puedes tener calidad, pero no ambas. Live Avatar resuelve esto cambiando la forma en que la IA "piensa" sobre el tiempo y la memoria. En lugar de intentar recordar cada detalle perfecto del pasado (lo que causa que la IA se confunda y derive), el sistema almacena una memoria "ruidosa". Imagina intentar recordar una canción tarareando la melodía de forma aproximada en lugar de intentar recordar cada nota perfectamente. Esta memoria "aproximada" actúa como un filtro, manteniendo la cara del personaje estable mientras permite que la boca se mueva de forma natural.
El equipo también inventó una forma ingeniosa de acelerar las cosas llamada Paralelismo de Pipeline de Forzado de Pasos Temporales (Timestep-forcing Pipeline Parallelism). Imagina una línea de montaje de una fábrica donde, en lugar de un solo trabajador haciendo cada paso de la construcción de un coche, tienes un equipo de trabajadores. En una IA de video normal, cada trabajador espera a que el anterior termine antes de poder empezar. Live Avatar cambia las reglas: cada trabajador en la línea (o cada chip informático, conocido como GPU) tiene asignado un paso específico. Mientras el Trabajador A está puliendo las ruedas, el Trabajor B está pintando la puerta y el Trabajador C está instalando el motor, todo al mismo tiempo. Esto convierte un proceso lento y secuencial en uno rápido y paralelo.
Los resultados son impresionantes. En una configuración con 5 potentes tarjetas gráficas H100, Live Avatar puede generar video a 45 fotogramas por segundo (FPS), lo cual es más rápido que la velocidad de la visión humana. Solo tarda 1.21 segundos en empezar a generar el primer fotograma después de que hablas. Lo más importante es que puede seguir funcionando para siempre. Los investigadores lo probaron haciendo que el avatar hablara durante más de 10,000 segundos (casi tres horas seguidas), y el personaje no derivó, no tuvo fallos y no perdió su identidad.
Esto no es solo una victoria teórica; el equipo construyó un nuevo campo de pruebas llamado GenBench para demostrar que otros métodos fallan en duraciones largas mientras que el suyo tiene éxito. Descubrieron que, aunque otros sistemas pueden verse bien durante unos segundos, empiezan a degradarse, cambiar de color o perder el rostro de la persona después de unos minutos. Live Avatar, sin embargo, se mantiene constante. Esto sugiere que, al combinar una estrategia de memoria "ruidosa" con un inteligente sistema de línea de montaje, finalmente podemos tener humanos digitales que estén listos para conversaciones infinitas en tiempo real.
El artículo descarta explícitamente la idea de que necesitas entrenar a la IA con horas de video para que funcione durante horas. En su lugar, demostraron que entrenar con clips cortos (unos 3 segundos) es suficiente, siempre que utilices su truco especial de "historia ruidosa". También argumentan contra la vieja creencia de que tienes que elegir entre un modelo rápido y de baja calidad, o uno lento y de alta calidad. Con su método, puedes tener un modelo masivo y de alta calidad que funcione en tiempo real.
Aunque el sistema es increíblemente rápido, los autores señalan que todavía hay un pequeño retraso. El tiempo desde que hablas hasta que el video aparece en pantalla es de aproximadamente 3 segundos cuando se incluye el tiempo de viaje de la red. Esto es lo suficientemente rápido para muchas interacciones, pero podría no ser lo suficientemente rápido para una conversación fluida cara a cara donde cada milisegundo cuenta. Sin embargo, para el streaming, los asistentes virtuales y la narrativa digital, esto es un salto masivo hacia adelante, sugiriendo que la era de los avatares digitales infinitos y en tiempo real ya no es solo un sueño.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.