← नवीनतम पेपर
💻 computer science

TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation

TeMuDance एक नवीन ढांचा है जो मैन्युअल रूप से एनोटेट किए गए संगीत-पाठ-गति डेटासेट की आवश्यकता के बिना, विजातीय डेटा स्रोतों को संरेखित करने के लिए एक मोशन-केंद्रित ब्रिजिंग प्रतिमान और लयबद्ध निष्ठा एवं अर्थ संबंधी सटीकता सुनिश्चित करने के लिए एक दोहरी-धारा फाइन-ट्यूनिंग रणनीति का लाभ उठाकर, संगीत-संचालित नृत्य निर्माण के लिए टेक्स्ट-गाइडेड नियंत्रण को सक्षम करता है।

मूल लेखक: Xinran Liu, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinran Liu, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किसी गाने के लिए एक डांस वीडियो बनाना चाहते हैं। आपके पास संगीत है, और आप चाहते हैं कि एक कंप्यूटर डांस मूव्स जनरेट करे।

समस्या:
मौजूदा AI डांस जनरेटर बेहद प्रतिभाशाली संगीतकारों की तरह हैं जो ताल (beat) के साथ तो एकदम सटीक चलते हैं, लेकिन निर्देशों को समझने में बहुत खराब हैं। यदि आप उनसे कहें, "डांसर से उसका दाहिना पैर किक करवाओ," तो वे आपकी बात को नजरअंदाज कर सकते हैं और बस अपनी मर्जी से नाचते रह सकते हैं। वे लय (rhythm) के मामले में बेहतरीन हैं, लेकिन वे आपके विशिष्ट विवरण या आदेशों को नहीं समझ पाते।

ऐसा क्यों है? क्योंकि एक AI को डांस करना सिखाने और उसे निर्देश सुनने के काबिल बनाने के लिए, आपको वीडियो के एक विशाल पुस्तकालय की आवश्यकता है जहाँ हर एक मूव को संगीत और एक टेक्स्ट विवरण (जैसे, "संगीत: जैज़, मूव: दाहिना पैर किक करें") दोनों के साथ टैग किया गया हो। ऐसे "ट्रिपल-थ्रेट" डेटासेट अभी मौजूद नहीं हैं। हमारे पास संगीत-डांस के जोड़े बहुत हैं, और टेक्स्ट-मोशन के जोड़े भी बहुत हैं, लेकिन वे दो अलग-अलग कमरों में हैं जो कभी एक-दूसरे से बात नहीं करते।

समाधान: TeMuDance
शोधकर्ताओं ने एक नया सिस्टम बनाया है जिसे TeMuDance कहा जाता है। इसे एक चतुर अनुवादक (translator) और एक मास्टर कंडक्टर के रूप में समझें। यह इस प्रकार काम करता है:

1. "मोशन ब्रिज" (दो द्वीपों को जोड़ना)

कल्पना कीजिए कि दो द्वीप हैं:

  • द्वीप A (संगीत और डांस): यहाँ हजारों गाने और बेहतरीन डांस हैं, लेकिन किसी ने यह नहीं लिखा कि वे मूव्स क्या अर्थ रखते हैं।
  • द्वीप B (टेक्स्ट और मोशन): यहाँ "कूदना", "घूमना" या "बाएं चलना" जैसे हजारों विवरण और उनके साथ जाने वाले मूव्स हैं, लेकिन कोई संगीत नहीं है।

TeMuDance इन दोनों द्वीपों के बीच एक पुल (bridge) बनाता है। यह "मोशन" को साझा भाषा के रूप में उपयोग करता है। यह द्वीप A पर एक डांस मूव को देखता है, द्वीप B पर एक समान मूव ढूंढता है जो उस विवरण से मेल खाता हो, और कहता है, "आह! यह डांस मूव 'स्पिन' (घूमना) टेक्स्ट के अनुरूप है।"

इस तरह, यह एक "चीट शीट" (डेटाबेस) बनाता है जो संगीत, टेक्स्ट और मूवमेंट को एक साथ जोड़ता है, भले ही उसने वास्तव में उन्हें कभी एक साथ न देखा हो।

2. "फ्रोजन बैकबोन" (लय बनाए रखने वाला)

यह सिस्टम एक पहले से प्रशिक्षित (pre-trained) AI से शुरू होता है जो पहले से ही एक विश्व स्तरीय डांसर है। वह ताल के साथ बिल्कुल सही ढंग से मूव करना जानता है। शोधकर्ताओं ने इस विशेषज्ञ डांसर को फिर से प्रशिक्षित (retrain) करने का निर्णय नहीं लिया क्योंकि वे इसके सटीक रिदम को बिगाड़ना नहीं चाहते थे।

इस विशेषज्ञ को एक जमी हुई मूर्ति (frozen statue) के रूप में सोचें जो संगीत के साथ पूरी तरह से तालमेल बिठाकर नाचती है। यह बेहतरीन है, लेकिन यह आपकी आवाज के आदेशों को नहीं सुन सकता।

3. "लाइटवेट एडैप्टर" (नया सहायक)

मूर्ति को पिघलाने के बजाय, वे उससे एक छोटा, लचीला सहायक (एक टेक्स्ट कंट्रोल ब्रांच) जोड़ देते हैं।

  • जब आप टाइप करते हैं "दाहिना पैर किक करो," तो यह सहायक आपके टेक्स्ट को पढ़ता है।
  • यह जमी हुई मूर्ति को निर्देश फुसफुसाता है, उसे उस विशिष्ट किक को करने के लिए प्रेरित करता है, जबकि वह संगीत की लय को बरकरार रखता है।
  • मूर्ति स्थिर रहती है (परफेक्ट बीट बनाए रखती है), लेकिन सहायक विशिष्ट मूव्स का मार्गदर्शन करता है।

4. "नॉइज़ फ़िल्टर" (क्वालिटी कंट्रोल)

चूंकि सिस्टम को दो द्वीपों के बीच के कनेक्शन का "अनुमान" लगाना पड़ा था, इसलिए उसके कुछ अनुमान गलत भी हो सकते हैं। यह एक जैज़ गाने को "चलने" के विवरण से मिलाने जैसा है; कभी-कभी मैच कमजोर होता है।

इसे ठीक करने के लिए, TeMuDance एक कॉन्फिडेंस फ़िल्टर का उपयोग करता है। यह केवल उन "सर्वश्रेष्ठ अनुमानों" का उपयोग करता है जहाँ संगीत और टेक्स्ट आपस में अच्छी तरह मेल खाते हैं। यदि कनेक्शन कमजोर है, तो यह उसे अनदेखा कर देता है। यह AI को बुरी आदतें सीखने से रोकता है।

5. "सफलता का पैमाना" (KPS)

उन्हें कैसे पता चलता है कि यह वास्तव में काम कर गया? उन्होंने एक नया टेस्ट बनाया जिसे Kinematic Primitive Success (KPS) कहा जाता है।
केवल यह पूछने के बजाय कि, "क्या यह कूल लग रहा है?" वे विशिष्ट प्रश्न पूछते हैं:

  • "क्या डांसर ने वास्तव में अपना पैर उठाया?"
  • "क्या वे उसी दिशा में घूमे जिसकी आपने मांग की थी?"
  • "क्या उन्होंने यह संगीत बजते समय किया?"

यदि AI आपके टेक्स्ट कमांड के लिए "हाँ" कहता है, तो स्कोर बढ़ जाता है।

परिणाम

TeMuDance एक द्विभाषी डांस इंस्ट्रक्टर की तरह है।

  • यह संगीत को सुन सकता है और ताल को पूरी तरह से बनाए रख सकता है (Rhythm)।
  • यह आपके टेक्स्ट निर्देशों को पढ़ सकता है और उसके अनुसार मूव्स बदल सकता है (Control)।
  • और यह सब वह बिना किसी विशाल, असंभव-से-मिलने वाले प्री-रिकॉर्डेड उदाहरणों के पुस्तकालय के कर सकता है।

संक्षेप में, यह दो अलग-अलग दुनियाओं (संगीत-डांस और टेक्स्ट-मोशन) के सर्वश्रेष्ठ को आपस में मिला देता है ताकि आप अंततः अपने AI को कह सकें, "इस गाने पर नाचो, लेकिन कोरस के दौरान एक स्पिन जरूर करना," और वह वास्तव में आपकी बात सुनेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →