← Últimos artículos
💻 computer science

FlowDance: Music-Driven Dance Video Generation with Parallel Pose and RGB Streams

El artículo presenta FlowDance, un marco de trabajo que genera videos de danza impulsados por música mediante la integración de flujos paralelos de pose y RGB con técnicas de inyección especializadas para la preservación del movimiento y la identidad, respaldado por un conjunto de datos de danza de alta resolución recientemente curado.

Autores originales: Genying Li, Boda Lin, Jiachen Li, Zijian Jia, Haojie Zheng, Yiming Wang, Shuchen Weng, Si Li

Publicado 2026-08-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Genying Li, Boda Lin, Jiachen Li, Zijian Jia, Haojie Zheng, Yiming Wang, Shuchen Weng, Si Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La música y el movimiento han compartido durante mucho tiempo una conversación profunda y tácita. Cuando comienza un ritmo, el cuerpo suele responder antes de que la mente pueda nombrar el compás. Durante décadas, científicos e ingenieros han intentado enseñar a las computadoras a comprender esta conexión, con la esperanza de crear máquinas que puedan observar una canción e inventar un baile para que coincida con ella. Los primeros intentos se centraron en el esqueleto del movimiento mismo, creando figuras de palitos digitales que podían saltar y girar al ritmo de una melodía. Si bien estos sistemas podían generar las formas básicas del movimiento, no podían capturar a la persona que los realizaba. Carecían del rostro específico, la vestimenta única y los detalles sutiles que hacen que un bailarín parezca un humano real en lugar de una colección de líneas. El desafío ha sido cerrar la brecha entre la idea abstracta de un baile y la realidad visual de una persona específica moviéndose al ritmo de la música, todo ello manteniendo el video fluido y creíble de principio a fin.

Un equipo de investigadores ha desarrollado ahora un nuevo sistema llamado FlowDance que aborda este desafío cambiando la forma en que la computadora piensa sobre la tarea. En lugar de intentar hacer todo en un solo paso gigante o dividir el proceso en etapas separadas y desconectadas, el sistema trabaja con dos flujos paralelos de información que corren uno al lado del otro. Un flujo se centra en la estructura del movimiento, creando un video simplificado de la pose del bailarín, mientras que el otro flujo se centra en la apariencia visual, generando el video real de la persona. Estos dos flujos se comunican constantemente mientras se crea el video. El flujo estructural guía al flujo visual, asegurando que las extremidades de la persona se muevan correctamente, mientras que el flujo visual asegura que el rostro y la ropa del bailarín se mantengan consistentes a lo largo del clip. Este enfoque permite al sistema generar un video donde un individuo específico baila naturalmente al ritmo de una canción, preservando su identidad y los detalles de su atuendo sin los errores que suelen afectar a los métodos anteriores.

Los intentos previos para resolver este problema a menudo dependían de una cadena de herramientas separadas. Una herramienta adivinaba la forma 3D del cuerpo, una segunda intentaba aplanar esa forma en un dibujo 2D y una tercera usaba ese dibujo para pintar el video final. Los investigadores descubrieron que los errores en los primeros pasos se acumulaban, lo que resultaba en videos donde las extremidades del bailarín podían estirarse repentinamente, su cuerpo podía cambiar de tamaño o su rostro podía verse distorsionado. Otros métodos intentaban hacerlo todo a la vez, mapeando la música y una foto directamente a un video, pero esto a menudo hacía que el movimiento fuera rígido o poco convincente porque la computadora tenía que resolver demasiados problemas complejos simultáneamente. FlowDance evita estas trampas manteniendo el movimiento y la generación de la imagen vinculados pero distintos. Utiliza un modelo de video preentrenado como base, luego añade una ruta específica para que la música influya en la pose, y otra ruta para mantener el rostro y el cuerpo del bailarín iguales a la foto original.

Para entrenar este sistema, los investigadores construyeron una gran colección de videos de baile de internet, seleccionando cuidadosamente clips que fueran de alta calidad y presentaran a una sola persona bailando. Reunieron más de 165,000 clips cortos, cada uno de cinco segundos de duración, y les añadieron etiquetas detalladas. Para cada video, registraron la música, los movimientos del bailarín en tres dimensiones, los ángulos de cámara y las posiciones 2D de las articulaciones. Este conjunto de datos, al que llamaron FlowDanceSet, permitió a la computadora aprender la relación entre el ritmo de la música y la forma específica en que se mueve un cuerpo humano, todo mientras veía cómo luce una persona real al hacerlo. El sistema fue luego probado con nuevas canciones y nuevos bailarines que nunca había visto antes. Los resultados mostraron que FlowDance producía videos más fluidos y realistas que otros métodos actuales. En pruebas comparando el resultado con videos hechos por otros sistemas, los observadores humanos prefirieron consistentemente los videos realizados por FlowDance, señalando que los bailarines parecían más naturales, los movimientos eran más fluidos y la conexión entre la música y el movimiento era más fuerte.

El sistema también introdujo una forma de manejar videos más largos sin perder la identidad del bailarín. A medida que el video se alarga, las computadoras a menudo luchan por recordar cómo era la persona en el primer fotograma, lo que lleva a un desfase donde el rostro o la ropa cambian ligeramente con el tiempo. FlowDance resuelve esto alimentando repetidamente la foto original del bailarín de vuelta al sistema en diferentes puntos durante el proceso de creación. Esto mantiene los detalles visuales bloqueados en su lugar, permitiendo al sistema generar secuencias que duran muchos segundos manteniendo una apariencia consistente. Los investigadores descubrieron que este método, combinado con los flujos paralelos, les permitió crear videos donde la ropa, la forma del cuerpo y los rasgos faciales del bailarín permanecían estables incluso mientras realizaba movimientos complejos y enérgicos. El trabajo demuestra que, al separar la tarea de planificar el movimiento de la tarea de renderizar la imagen, pero manteniéndolas en constante comunicación, es posible crear videos de baile que sean tanto estructuralmente precisos como visualmente convincentes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →