← नवीनतम पेपर
💻 computer science

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

यह शोध पत्र Wan-Dancer को प्रस्तुत करता है, जो एक नवीन पदानुक्रमित ढांचा (hierarchical framework) है जो वैश्विक कीफ्रेम योजना (global keyframe planning) को स्थानीय टेम्पोरल रिफाइनमेंट (local temporal refinement) से अलग करके, संगीत से सीधे मिनट-स्तर के, उच्च-परिभाषा (720p/30fps), और लयबद्ध रूप से सुसंगत नृत्य वीडियो उत्पन्न करने के लिए मौजूदा डिफ्यूजन मॉडल्स की टेम्पोरल सीमाओं को दूर करता है।

मूल लेखक: Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Bang Zhang

प्रकाशित 2026-07-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Bang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप पूरे गाने के लिए एक डांस कोरियोग्राफ करने की कोशिश कर रहे हैं, लेकिन आपका दिमाग केवल 15 सेकंड तक के मूव्स याद रख पाता है, जिसके बाद वह ग्लिच करने लगता है, डांसर का चेहरा भूल जाता है, या उसे अपने ही पैरों में उलझा देता है। अधिकांश AI डांस जनरेटर की वर्तमान स्थिति यही है। वे छोटे अंतराल के लिए बेहतरीन हैं, लेकिन जैसे ही आप उनसे एक मिनट लंबे प्रदर्शन के लिए कहते हैं, वीडियो डगमगाने लगता है, डांसर की पहचान झिलमिलाने लगती है और लय बिगड़ जाती है।

यहाँ आता है Wan-Dancer, जो अलीबाबा की टोंगी लैब (Tongyi Lab) का एक नया फ्रेमवर्क है। यह एक मास्टर कोरियोग्राफर की तरह काम करता है जिसके पास एक सुपरपावर है: यह बिना अपना धैर्य खोए, शुरू से अंत तक पूरे डांस की योजना बना सकता है।

समस्या: छोटी याददाश्त का "भूलने की बीमारी" (Amnesia)

वर्तमान AI मॉडल बहुत कम समय की याददाश्त वाले डांसर्स की तरह हैं। यदि आप उनसे 20 सेकंड तक नाचने को कहें, तो वे शानदार दिखते हैं। लेकिन यदि आप उन्हें 60 सेकंड या उससे अधिक के लिए मजबूर करते हैं, तो वे "टेम्पोरल ड्रिफ्ट" (temporal drift) का शिकार हो जाते हैं। इसका मतलब है कि डांसर गाना शुरू करते समय एक पॉप स्टार जैसा दिख सकता है और खत्म होते समय पूरी तरह से अलग व्यक्ति जैसा दिख सकता है, या उनके मूवमेंट दोहराव वाले और रोबोटिक हो सकते हैं। पिछले तरीकों ने छोटे क्लिप्स को जोड़कर इसे ठीक करने की कोशिश की, लेकिन यह एक मूवी रील को टेप से जोड़ने जैसा है; आप हमेशा उसके जोड़ (seams) देख सकते हैं, और कहानी बिखर जाती है।

समाधान: "ग्लोबल प्लानर" और "लोकल डांसर"

Wan-Dancer इस काम को दो अलग-अलग भूमिकाओं में विभाजित करके हल करता है, जो एक पदानुक्रमित टीम (hierarchical team) के रूप में मिलकर काम करती हैं:

  1. द ग्लोबल प्लानर (बड़ी तस्वीर): सबसे पहले, AI एक बार में पूरे गाने को देखता है। यह केवल अगले मूव का अनुमान नहीं लगाता; यह पूरे मिनट में फैले हुए डांस के "कीफ्रेम्स" (keyframes)—यानी प्रमुख पोज़ और संरचनात्मक क्षणों—की योजना बनाता है। इसे एक वास्तुकार (architect) द्वारा एक ईंट रखने से पहले गगनचुंबी इमारत का ब्लूप्रिंट बनाने जैसा समझें। यह सुनिश्चित करता है कि डांसर को पता हो कि वह 50वें सेकंड पर कहाँ होगा, भले ही वह 5वें सेकंड पर नाच रहा हो।
  2. द लोकल रिफाइनर (विवरण): एक बार ब्लूप्रिंट तैयार हो जाने के बाद, सिस्टम का दूसरा हिस्सा खाली जगहों को भरता है। यह उन मुख्य पोज़ को लेता है और उनके बीच के स्मूथ, हाई-डेफिनिशन फ्रेम्स जेनरेट करता है। यहीं पर तरल गति (fluid motion) का जादू होता है, जो यह सुनिश्चित करता है कि डांसर एक पोज़ से दूसरे पोज़ में टेलीपोर्ट न हो, बल्कि स्थान में सहजता से फिसले।

सीक्रेट सॉस: तीन शानदार ट्रिक्स

इसे काम करने के योग्य बनाने के लिए, शोधकर्ताओं ने अपने टूलकिट में तीन विशिष्ट उपकरण जोड़े हैं:

  • टाइम-ट्रैवलिंग क्लॉक (डायनेमिक फ्रेम रेट): संगीत हमेशा एक ही गति का नहीं होता। कभी यह एक धीमा बैलेड होता है; कभी यह एक तेज़ टेक्नो ट्रैक। Wan-Dancer एक विशेष "टाइम-मैप्ड" क्लॉक (जिसे RoPE एम्बेडिंग्स कहा जाता है) का उपयोग करता है जो AI को बताता है कि कितने फ्रेम्स प्रति सेकंड जेनरेट किए जा रहे हैं, इससे फर्क नहीं पड़ता। यह AI को 3-सेकंड के बीट या 10-सेकंड के स्लो-मोशन स्ट्रेच के साथ पूरी तरह से तालमेल बिठाने की अनुमति देता है बिना भ्रमित हुए।
  • मोशन ब्लर शील्ड (ऑप्टिकल फ्लो लॉस): जब एक डांसर तेज़ी से घूमता है, तो चीजें धुंधली हो जाती हैं। पुराने AI मॉडल बस इमेज को फैला देते थे, जिससे हाथ एक धब्बे जैसा बन जाता था। Wan-Dancer एक "ऑप्टिकल फ्लो" लॉस फंक्शन का उपयोग करता है। इसे एक सख्त शिक्षक के रूप में समझें जो वीडियो के हर फ्रेम की जांच करता है ताकि यह सुनिश्चित हो सके कि मूवमेंट बिल्कुल सही है। यदि AI तेज़ स्पिन के दौरान विवरणों को धुंधला करने की कोशिश करता है, तो शिक्षक कहता है, "नहीं, इसे ठीक करो," जिससे तेज़ गति पर भी डांसर स्पष्ट रहता है।
  • स्पीड डायल (मोशन कंट्रोल): सिस्टम को धीमी, मध्यम और तेज़ गतिविधियों को अलग-अलग तरीके से संभालने के लिए प्रशिक्षित किया गया था। इसने सीखा कि "मध्यम" गति आमतौर पर मानव नृत्य के लिए सबसे अच्छी होती है, जो AI को बहुत धीमी (उबाऊ) या बहुत तेज़ (शारीरिक रूप से असंभव और ग्लिच वाली) हरकतें करने से रोकती है।

परिणाम: एक मिनट का जादू

टीम ने इसका परीक्षण लगभग 200 घंटों के उच्च-गुणवत्ता वाले डांस वीडियो के विशाल डेटासेट पर किया, जिसमें पांच अलग-अलग शैलियाँ शामिल थीं: चीनी शास्त्रीय (Chinese Classical), के-पॉप (K-Pop), लैटिन (Latin), टैप (Tap), और स्ट्रीट डांस (Street dance)

परिणाम प्रभावशाली हैं। Wan-Dancer 720p रेजोल्यूशन पर 30 फ्रेम्स प्रति सेकंड के साथ स्थिर वीडियो जेनरेट कर सकता है जो एक मिनट से अधिक (विशेष रूप से, उन्होंने 160 सेकंड तक का प्रदर्शन किया) चलते हैं।

  • पहचान (Identity): डांसर पहले सेकंड से लेकर आखिरी सेकंड तक एक ही व्यक्ति जैसा दिखता है।
  • लय (Rhythm): मूव्स संगीत के बीट्स पर पूरी तरह से सटीक बैठते हैं।
  • बहुमुखी प्रतिभा (Versatility): यह एक साधारण टेक्स्ट प्रॉम्प्ट के आधार पर डांस स्टाइल बदल सकता है, जैसे "एक डांसर लैटिन डांस कर रहा है।"

उन्होंने यह भी दिखाया कि आप केवल 16 रेफरेंस वीडियो और LoRA (Low-Rank Adaptation) नामक तकनीक का उपयोग करके AI को एक विशिष्ट रूटीन सिखा सकते हैं। इसका मतलब है कि आप पूरे सिस्टम को फिर से प्रशिक्षित किए बिना एक विशिष्ट कोरियोग्राफी की नकल करने के लिए AI को तैयार कर सकते हैं।

यह क्या नहीं है (और आगे क्या है)

यह ध्यान रखना महत्वपूर्ण है कि Wan-Dancer अभी क्या नहीं करता है। यह 3D कंकाल (skeletons) जेनरेट नहीं करता जिन्हें आपको बाद में रेंडर करना पड़े; यह सीधे वीडियो में जाता है। हालांकि, लेखक स्वीकार करते हैं कि यह पूर्ण नहीं है।

  • चेहरे की निरंतरता (Face Consistency): जबकि शरीर सुसंगत रहता है, बहुत लंबे अनुक्रमों में चेहरा थोड़ा झिलमिला सकता है। वे भविष्य में इसे ठीक करने की योजना बना रहे हैं।
  • ग्रुप डांसिंग: फिलहाल, यह एक एकल प्रदर्शन (solo act) है। वे इसे डांसर्स के समूहों को एक-दूसरे के साथ इंटरैक्ट करते हुए कोरियोग्राफ करना सिखाना चाहते हैं।
  • नैतिकता (Ethics): टीम बहुत स्पष्ट है: यह कला बनाने के लिए है, न कि फर्जी खबरें या डीपफेक बनाने के लिए। वे वादा करते हैं कि सभी आउटपुट को स्पष्ट रूप से AI-जेनरेटेड के रूप में लेबल किया जाएगा।

संक्षेप में, Wan-Dancer सुझाव देता है कि एक बड़ी समस्या को "बड़ी तस्वीर" की योजना और "बारीक विवरण" के निष्पादन में तोड़कर, हम अंततः AI को पूरे गाने पर थिरकने में सक्षम बना सकते हैं बिना लय खोए। यह एक महत्वपूर्ण प्रगति है, जो हमें 15-सेकंड के क्लिप्स से हटाकर पूर्ण-मिनट के प्रदर्शनों की ओर ले जाती है जो वास्तव में ऐसा दिखाते हैं जैसे कोई वास्तविक इंसान नाच रहा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →