← Últimos artículos
💻 computer science

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

El artículo presenta JoyAI-Echo-1.5, un sistema unificado de generación audiovisual que cuenta con una variante de video largo con memoria entre tomas para la consistencia persistente de personajes y una variante de modelo de mundo con control de cámara geométrico para la navegación interactiva, ambos optimizados mediante entrenamiento consciente del despliegue (rollout-aware training) para lograr un rendimiento de vanguardia en la narración de largo alcance y la generación de mundos interactivos.

Autores originales: Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang

Publicado 2026-08-25
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde una computadora no solo pueda crear un único clip de video, sino que pueda tejer una historia completa, manteniendo a los personajes con la misma apariencia y voz desde la primera escena hasta la última, o incluso permitir que un espectador camine a través de un paisaje digital, girando la cabeza y avanzando con una estabilidad perfecta. Esta es la frontera de la generación de video, un campo donde la inteligencia artificial aprende a sintetizar imágenes en movimiento y sonido. Durante años, estos sistemas han sido como pintores hábiles que pueden crear un retrato hermoso pero luchan por pintar una galería entera donde cada rostro permanezca constante, o como un narrador que olvida la trama después de unas pocas frases. El desafío ha sido ir más allá de los momentos aislados para crear narrativas largas y coherentes y mundos interactivos que no se desmoronen ni pierdan su identidad a medida que crecen.

Un equipo de investigadores de la Joy Future Academy ha presentado un nuevo sistema, JoyAI-Echo-1.5, diseñado para resolver estos problemas específicos. En lugar de solo hacer mejores clips individuales, este sistema se enfoca en dos objetivos distintos pero relacionados: crear historias de larga duración donde los personajes y las voces permanezcan consistentes, y construir mundos interactivos que respondan con precisión a los movimientos de un usuario. Los investigadores descubrieron que al darle a la computadora una forma de "recordar" escenas pasadas y al enseñarle a comprender la geometría del movimiento, podían generar secuencias extendidas de video que se mantuvieran estables y fieles a las instrucciones originales.

La primera parte de este sistema aborda el problema de las historias largas. En intentos anteriores, si un personaje aparecía en una escena y luego el video cortaba a una nueva ubicación, el personaje podía reaparecer con un aspecto ligeramente distinto o hablando con una voz cambiada. JoyAI-Echo-1.5 resuelve esto construyendo un banco de memoria. A medida que el sistema genera una historia, guarda detalles visuales y auditivos específicos de tomas anteriores. Cuando un personaje reaparece, el sistema consulta esta memoria para asegurar que su rostro, vestimenta y voz coincidan con lo establecido anteriormente. Lo hace analizando el audio completo de una escena previa para capturar el tono único del hablante, en lugar de solo un breve fragmento, y guardando imágenes del personaje desde diferentes ángulos. Esto permite que la computadora genere una secuencia de tomas que se sientan como una película continua, donde un héroe puede viajar a través de diferentes entornos sin perder su identidad.

La segunda parte del sistema está diseñada para mundos interactivos, donde un usuario puede querer controlar una cámara para explorar un entorno digital. En el pasado, dar a una computadora un comando como "moverse hacia adelante" o "girar a la izquierda" a menudo resultaba en movimientos bruscos y antinaturales, o en una escena que se deformaba y cambiaba de forma lentamente a medida que el video se reproducía. El nuevo sistema traduce estos comandos en una descripción matemática precisa de cómo se mueve la cámara a través del espacio. Trata al mundo como un espacio tridimensional estable que existe independientemente de la cámara. Cuando un usuario se mueve, el sistema calcula la trayectoria exacta y ajusta el video en consecuencia, asegurando que las paredes, los objetos y la iluminación permanezcan consistentes sin importar cuánto continúe la exploración. Esto permite una experiencia suave y continua donde el mundo digital se siente sólido y real, en lugar de una ilusión cambiante.

Para que estos sistemas sean lo suficientemente rápidos como para ser útiles, los investigadores también desarrollaron una nueva forma de entrenarlos. Usualmente, crear video de alta calidad requiere muchos pasos de cálculo, lo que toma mucho tiempo. El equipo enseñó al sistema a aprender de sus propios errores, haciendo que generara video y luego intentara inmediatamente mejorar ese video basándose en lo que acababa de crear. Este proceso, que involucra una técnica llamada forzado de gradiente propio (self-gradient forcing), permite que el sistema se vuelva estable incluso cuando está generando secuencias largas por su cuenta. También utilizaron un método para comprimir el proceso de generación, permitiendo que el sistema produzca video de alta calidad en solo unos pocos pasos en lugar de docenas, sin perder los detalles finos o la sincronización entre el sonido y la imagen.

Los resultados de este trabajo fueron probados contra otros sistemas líderes. En pruebas que involucraban historias largas, el nuevo sistema fue mejor para mantener la consistencia de los personajes y hacer coincidir las palabras habladas con los movimientos de los labios que cualquier modelo anterior. En pruebas de mundos interactivos, obtuvo una puntuación más alta que sus competidores en mantener la forma del entorno y seguir con precisión los comandos de movimiento del usuario. Una prueba específica mostró que el sistema podía generar un video continuo de sesenta segundos donde la cámara se movía a través de una escena compleja, y el sistema mantuvo la perspectiva y la calidad visual correctas durante todo el proceso, una hazaña que otros modelos tuvieron dificultades para lograr sin que la escena se desviara o se distorsionara.

Esta investigación sugiere que la clave para crear historias persistentes y mundos interactivos estables reside en cómo la computadora recuerda el pasado y comprende la geometría del presente. Al combinar una memoria robusta para los detalles visuales y auditivos con una comprensión precisa del movimiento, el sistema puede generar contenido que se sienta coherente a lo largo del tiempo. Aunque quedan desafíos, particularmente en mantener la cámara perfectamente estable durante movimientos muy largos y complejos, el trabajo demuestra un avance significativo. Muestra que la inteligencia artificial puede ir más allá de la creación de clips aislados para sostener narrativas completas y mundos en evolución, abriendo la puerta a experiencias digitales más inmersivas y confiables.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →