← Nieuwste papers
💻 computer science

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

Het artikel introduceert Wan-Dancer, een nieuw hiërarchisch framework dat de temporele beperkingen van bestaande diffusiemodellen overwint om minutenlange, hoogdefinitie (720p/30fps) en ritmisch coherente dansvideo's direct uit muziek te genereren door globale keyframe-planning te ontkoppelen van lokale temporele verfijning.

Oorspronkelijke auteurs: Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Bang Zhang

Gepubliceerd 2026-07-13
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Bang Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een dans probeert te choreograferen voor een heel liedje, maar je brein kan zich slechts de bewegingen van ongeveer 15 seconden herinneren voordat het begint te haperen, het gezicht van de danser vergeet of de danser over de eigen voeten laat struikelen. Dat is de huidige staat van de meeste AI-dansgeneratoren. Ze zijn geweldig in korte uitbarstingen, maar zodra je om een minuut durende uitvoering vraagt, begint de video te wankelen, flikkert de identiteit van de danser en valt het ritme uit elkaar.

Maak kennis met Wan-Dancer, een nieuw framework van Alibaba's Tongyi Lab dat fungeert als een meesterchoreograaf met een superkracht: het kan de hele dans van begin tot eind plannen zonder de controle te verliezen.

Het Probleem: De "Amnesie" van Korte Geheugens

Huidige AI-modellen zijn als dansers met een zeer kortetermijngeheugen. Als je ze vraagt om 20 seconden te dansen, zien ze er geweldig uit. Maar als je ze pusht naar 60 seconden of meer, lijden ze aan "temporele drift". Dit betekent dat de danser aan het begin van het liedje misschien op een popster lijkt en aan het einde op een totaal ander persoon, of dat de bewegingen repetitief en robotachtig worden. Eerdere methoden probeerden dit op te lossen door korte clips aan elkaar te naaien, maar dat is alsof je een filmrol aan elkaar plakt met tape; je ziet de naden altijd, en het verhaal valt uit elkaar.

De Oplossing: De "Global Planner" en de "Local Dancer"

Wan-Dancer lost dit op door de taak te splitsen in twee duidelijke rollen, die samenwerken in een hiërarchisch team:

  1. De Global Planner (Het Grote Plaatje): Eerst bekijkt de AI het hele liedje in één keer. De AI raadt niet alleen de volgende beweging; het plant de "keyframes"—de belangrijkste poses en structurele momenten van de dans—verspreid over de hele minuut. Denk hierbij aan een architect die de blauwdruk van een wolkenkrabber tekent voordat er een enkele baksteen wordt gelegd. Dit zorgt ervoor dat de danser weet waar hij zich op het 50-seconden-teken zal bevinden, terwijl hij nog aan het dansen is op het 5-seconden-teken.
  2. De Local Refiner (De Details): Zodra de blauwdruk is vastgesteld, vult een tweede deel van het systeem de gaten in. Het neemt die sleutelposes en genereert de vloeiende, high-definition frames ertussenin. Dit is waar de magie van vloeiende beweging gebeurt, wat ervoor zorgt dat de danser niet van de ene naar de andere pose teleporteert, maar door de ruimte glijdt.

Het Geheim: Drie Coole Trucs

Om dit werkend te krijgen, hebben de onderzoekers drie specifieke instrumenten aan hun gereedschapskist toegevoegd:

  • De Tijdreizende Klok (Dynamic Frame Rate): Muziek is niet altijd even snel. Soms is het een langzame ballad; soms is het een snelle techno-track. Wan-Dancer gebruikt een speciale "tijd-gemapte" klok (genaamd RoPE embeddings) die de AI precies vertelt hoeveel tijd er is verstreken, ongeacht hoeveel frames per seconde er worden gegenereerd. Hierdoor kan de AI perfect synchroon lopen met een 3-seconden beat of een 10-seconden slow-motion stretch zonder in de war te raken.
  • Het Bewegingsonscherpte-schild (Optical Flow Loss): Wanneer een danser snel draait, wordt alles wazig. Oude AI-modellen maken er gewoon een veeg van, waardoor een hand verandert in een vlek. Wan-Dancer gebruikt een "optical flow" loss function. Stel je dit voor als een strenge leraar die de video frame voor frame controleert om er zeker van te zijn dat de beweging perfect aansluit. Als de AI probeert de details te vervagen tijdens een snelle draai, zegt de leraar: "Nee, verbeter die hand," zodat de danser ook bij hoge snelheden scherp blijft.
  • De Snelheidsregelaar (Motion Control): Het systeem is getraind om langzame, gemiddelde en snelle bewegingen verschillend af te handelen. Het heeft geleerd dat "gemiddelde" snelheid meestal het ideale punt is voor menselijke dans, wat voorkomt dat de AI bewegingen maakt die te traag zijn (saai) of te snel (fysiek onmogelijk en glitchy).

De Resultaten: Een Minuut aan Magie

Het team heeft dit getest op een enorme dataset van ongeveer 200 uur aan hoogwaardige dansvideo's, verdeeld over vijf verschillende stijlen: Chinese Klassieke Dans, K-Pop, Latin, Tap en Street dance.

De resultaten zijn indrukwekkend. Wan-Dancer kan stabiele video's genereren met een 720p resolutie op 30 frames per seconde die langer dan één minuut duren (specifiek hebben ze tot 160 seconden gedemonstreerd).

  • Identiteit: De danser ziet er van de eerste tot de laatste seconde uit als dezelfde persoon.
  • Ritme: De bewegingen raken de beats van de muziek perfect.
  • Veelzijdigheid: Het kan tussen dansstijlen schakelen op basis van een eenvoudige tekstprompt, zoals "Een danser voert een Latin-dans uit."

Ze hebben ook laten zien dat je de AI een specifieke routine kunt aanleren met slechts 16 referentievideo's en een techniek genaamd LoRA (Low-Rank Adaptation). Dit betekent dat je de AI een specifieke choreografie kunt laten imiteren zonder het hele systeem van de grond af aan opnieuw te hoeven trainen.

Wat het NIET is (En Wat Volgt)

Het is belangrijk om op te merken wat Wan-Dancer nog niet doet. Het genereert geen 3D-skeletten die je later moet renderen; het gaat direct naar de video. De auteurs geven echter toe dat het nog niet perfect is.

  • Gezichtsconsistentie: Hoewel het lichaam consistent blijft, kan het gezicht over zeer lange sequenties nog steeds licht flikkeren. Ze zijn van plan dit in de toekomst te repareren.
  • Groepsdans: Op dit moment is het een solo-act. Ze willen de AI leren hoe ze groepen dansers moet choreograferen die met elkaar interageren.
  • Ethiek: Het team is heel duidelijk: dit is bedoeld voor het creëren van kunst, niet voor het maken van nepnieuws of deepfakes. Ze beloven dat alle outputs duidelijk als AI-gegenereerd gelabeld zullen worden.

Kortom, Wan-Dancer suggereert dat door een groot probleem op te splitsen in een "groot plaatje"-plan en een "fijne detail"-uitvoering, we eindelijk AI de hele song kunnen laten dansen zonder de maat te verliezen. Het is een belangrijke stap voorwaarts, waarbij we bewegen van 15-seconden clips naar volledige minuten durende optredens die er daadwerkelijk uitzien alsof een echt mens danst.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →