← Últimos artículos
💻 computer science

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

Avatar-Forever es un marco de entrenamiento paralelo desacoplado que combina la destilación de parámetros completos para una alta calidad visual con un adaptador de largo horizonte ligero entrenado mediante el Entrenamiento de Rollout orientado a la Recuperación, permitiendo la generación estable, en tiempo real e infinita de avatares impulsados por audio en una sola GPU H100.

Autores originales: Ruibin Li, Tao Yang, Zhiyuan Ma, Fangzhou Ai, Shilei Wen, Lei Zhang

Publicado 2026-08-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ruibin Li, Tao Yang, Zhiyuan Ma, Fangzhou Ai, Shilei Wen, Lei Zhang

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo en el que puedes hablar con un amigo digital que se ve, se mueve y habla exactamente como una persona real, para siempre. Esto no es solo un sueño de película de ciencia ficción; es el objetivo de un campo llamado computación visual, donde los científicos enseñan a las computadoras a entender y crear imágenes en movimiento. Para lograr esto, los investigadores utilizan modelos de IA —cerebros digitales masivos entrenados con millones de videos— para aprender cómo lucen y se mueven los humanos. Un desafío clave en este campo es la generación de video por streaming. Piensa en esto como una carrera de relevos: la computadora genera unos pocos segundos de video, luego utiliza ese resultado como punto de partida para los siguientes segundos, y así sucesivamente. El problema es que, si la computadora comete un pequeño error en los primeros segundos, ese error se transmite a lo largo de la línea, creciendo más grande y extraño con cada paso, hasta que la persona digital comienza a derretirse o a olvidar quién es. Este artículo aborda el dolor de cabeza de mantener a estos humanos digitales luciendo perfectos y actuando de forma natural, incluso cuando hablan durante horas sin detenerse.

Los investigadores detrás de Avatar-Forever se dieron cuenta de que intentar solucionar este problema de la "carrera de relevos" con los métodos antiguos era como intentar enseñarle a un estudiante a correr rápido y a no tropezar al mismo tiempo usando un único y confuso plan de estudios. La forma antigua intentaba comprimir dos objetivos muy diferentes en un solo proceso de entrenamiento: hacer que la generación de video fuera súper rápida (para que se sienta en tiempo real) y hacer que fuera súper robusta (para que no se desmorone después de un minuto). Los autores argumentan que estos dos objetivos en realidad luchan entre sí. Si te enfocas demasiado en la velocidad, el video se vuelve inestable; si te enfocas demasiado en corregir errores, se vuelve demasiado lento.

Así que, en lugar de forzar a la computadora a aprender ambas habilidades a la vez, Avatar-Forever divide el entrenamiento en dos clases separadas y paralelas. Imagina un gimnasio digital con dos pistas diferentes. En la primera pista, la Rama de Eficiencia (Efficiency Branch), la IA practica correr un sprint. Aprende a generar video de alta calidad en solo unos pocos pasos, enfocándose puramente en la velocidad y en verse bien a corto plazo. En la segunda pista, la Rama de Robustez (Robustness Branch), la IA practica una habilidad diferente: la recuperación. Aquí, los investigadores alteran deliberadamente el punto de partida de la IA —desenfocando la imagen, añadiendo ruido o escondiendo partes del rostro— y luego le piden a la IA que genere los siguientes segundos de video de todos modos. Esto se llama Entrenamiento de Despliegue Orientado a la Recuperación (RRT). Es como enseñarle a un gimnasta a hacer una voltereta hacia atrás perfecta incluso si tropieza en el primer paso. La IA aprende a corregir sus propios errores a medida que ocurren, en lugar de simplemente esperar que no ocurran.

Una vez que la IA ha entrenado en ambas pistas, los investigadores combinan las dos habilidades. Toman al corredor rápido y al experto en recuperación y los fusionan en un superatleta. Este nuevo avatar puede generar video en tiempo real y, al mismo tiempo, ser lo suficientemente resistente como para hablar durante horas sin perder su identidad o su compostura. Para hacer esto aún más rápido, introdujeron un truco ingenioso llamado ForeverCache. Normalmente, cada vez que la IA genera un nuevo fragmento de video, tiene que volver a leer todo el historial de lo que acaba de crear, lo cual es como volver a leer un libro entero cada vez que escribes una nueva oración. ForeverCache es como un marcador inteligente; recuerda las partes estables de la historia (el fondo, el rostro de la persona) para que la IA no tenga que recalcularlas cada vez. Solo se enfoca en las nuevas palabras que se están escribiendo en este momento.

Los resultados son impresionantes. Construido sobre un modelo fundacional de video masivo de 22 mil millones de parámetros, Avatar-Forever puede generar videos de alta resolución (768 × 512 píxeles) a 27.2 fotogramas por segundo en una sola tarjeta gráfica H100 potente. Eso es lo suficientemente rápido para la interacción en tiempo real. En las pruebas, el sistema logró mantener un avatar digital hablando naturalmente durante más de 11 minutos sin que el rostro se derritiera, la voz se desviara o los movimientos se volvieran robóticos. Mientras que otros métodos comenzaron a mostrar "deriva de identidad" (donde la persona parece una persona diferente) o gestos repetitivos y rígidos después de un tiempo, Avatar-Forever mantuvo la consistencia del personaje y el movimiento fluido. El equipo también creó un conjunto de datos completamente sintético para entrenar el modelo, lo que significa que ellos mismos generaron los videos de entrenamiento utilizando IA para asegurar una calidad y alineación perfectas, evitando el desorden de los videos reales de internet.

El artículo sugiere que este enfoque de "pista dividida" es una mejor manera de construir humanos digitales duraderos que los antiguos métodos enredados. Al separar la necesidad de velocidad de la necesidad de estabilidad, los investigadores encontraron un camino práctico para crear personas digitales que pueden hablarnos, enseñarnos o entretenernos indefinidamente, sin los fallos digitales que suelen arruinar la ilusión. Aunque el sistema está optimizado actualmente para servidores potentes y aún no para computadoras domésticas, abre la puerta a un futuro donde nuestros compañeros digitales pueden estar con nosotros tanto como lo necesitemos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →