← नवीनतम पेपर
⚡ electrical engineering

Controllable Dance Generation with Style-Guided Motion Diffusion

यह शोधपत्र स्टाइल-गाइडेड मोशन डिफ्यूजन (SGMD) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो यथार्थवादी, संगीत-संरेखित नृत्य अनुक्रम उत्पन्न करने के लिए एक ट्रांसफॉर्मर-आधारित आर्किटेक्चर को स्टाइल मॉड्यूलेशन मॉड्यूल और स्थानिक-कालिक मास्किंग के साथ एकीकृत करता है, जो प्रक्षेपवक्र जनरेशन (trajectory generation), इन-बिटवीनिंग (in-betweening) और इनपेंटिंग (inpainting) जैसे कार्यों के लिए शैलीगत रूप से सुसंगत और लचीले ढंग से नियंत्रणीय हैं।

मूल लेखक: Hongsong Wang, Ying Zhu, Xin Geng, Liang Wang

प्रकाशित 2026-03-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongsong Wang, Ying Zhu, Xin Geng, Liang Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कोरियोग्राफर हैं जो एक रोबोट को डांस करना सिखाने की कोशिश कर रहे हैं। आपके पास दो बड़ी समस्याएँ हैं:

  1. रोबोट उबाऊ है: वह बार-बार एक ही तरह का मूव करता रहता है, या वह संगीत के मिजाज (vibe) से मेल नहीं खाता।
  2. रोबोट कठोर (Rigid) है: आप उसे यह नहीं कह सकते कि, "हे, अपने पैर स्थिर रखो लेकिन अपने हाथ हिलाओ," या "एक धीमी स्पिन के साथ शुरू करो और फिर गति बढ़ा दो।" वह बस अपनी मर्जी से कुछ भी करता है।

यह पेपर एक नया सिस्टम पेश करता है जिसे SGMD (स्टाइल-गाइडेड मोशन डिफ्यूजन) कहा जाता है, जो इन दोनों समस्याओं को हल करता है। इसे एक रोबोट को संगीत का कान, एक व्यक्तित्व (personality), और एक ट्रेनिंग व्हील्स (सहायक पहियों) देने के रूप में समझें जिन्हें आप चलते-फिरते एडजस्ट कर सकते हैं।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "डिफ्यूजन" प्रक्रिया: मूर्तिकार की मिट्टी (The Sculptor's Clay)

एक संगमरमर के ब्लॉक की कल्पना करें जो कोहरे से ढका हुआ है। शुरू में, आप मूर्ति को देख नहीं सकते; यह बस एक धुंधला सा ढेर है।

  • पुराना AI: मूर्ति का तुरंत अनुमान लगाने की कोशिश करता है। वह अक्सर गलत हो जाता है या एक अजीब, जमी हुई मूर्ति बना देता है।
  • यह नया AI (डिफ्यूजन): उस कोहरे वाले ब्लॉक से शुरू होता है और धीरे-धीरे, कदम-दर-कदम, कोहरे को हटा देता है। हर बार कोहरा हटाने के साथ, डांस मूव्स अधिक स्पष्ट और परिभाषित होते जाते हैं जब तक कि एक परफेक्ट, तरल (fluid) डांस उभर कर नहीं आता। इस "कोहरा हटाने" की प्रक्रिया को डिफ्यूजन कहा जाता है। यह कला प्रकट होने तक शोर (noise) को धीरे-धीरे हटाने जैसा है।

2. "स्टाइल गाइड": निर्देशक की स्क्रिप्ट (The Director's Script)

पहले, यदि आप रोबोट को कहते, "इस गाने पर नाचो," तो वह रोबोट की तरह, बैले डांसर की तरह, या हिप-हॉप कलाकार की तरह नाच सकता था, लेकिन उसे यह नहीं पता होता कि कौन सा चुनना है। यह बिना शैली (genre) बताए अभिनेता को स्क्रिप्ट देने जैसा था।

यह नया सिस्टम एक स्टाइल मॉड्यूलेशन (Style Modulation) लेयर जोड़ता है।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक फिल्म निर्देशित कर रहे हैं। आप अभिनेता को बताते हैं, "यह एक दुखद दृश्य है," या "यह एक ऊर्जावान पार्टी है।"
  • यह कैसे काम करता है: सिस्टम टेक्स्ट प्रॉम्प्ट (जैसे "हाउस डांस," "स्ट्रीट जैज़," या यहाँ तक कि एक लंबी व्याख्या जैसे "ऊर्जावान स्पिन और पावर मूव्स") स्वीकार करता है। यह एक विशेष "अनुवादक" (एक हल्का मॉड्यूल) का उपयोग करता है जो लय को बिगाड़े बिना उस व्यक्तित्व को डांस में डाल देता है। यह सुनिश्चित करता है कि रोबोट सही "आत्मा" के साथ नाचे।

3. "स्पेशियल-टेम्पोरल मास्क": ट्रेनिंग व्हील्स (The Training Wheels)

यह "नियंत्रण योग्य" हिस्सा है। कभी-कभी आप नहीं चाहते कि रोबोट पूरा डांस खुद बनाए; आप चाहते हैं कि आप उसे एक ढांचा (skeleton) दें और वह बाकी हिस्सों को भर दे।

  • उपमा: कल्पना कीजिए कि यह एक कलरिंग बुक है जहाँ आप एक डांसर के पैरों की रूपरेखा खींचते हैं, और AI को बाकी शरीर को रंगना होता है। या, कल्पना कीजिए कि आप चाहते हैं कि डांसर मंच के बाईं ओर से शुरू करे और दाईं ओर समाप्त करे, लेकिन आप चाहते हैं कि AI बीच के स्टेप्स खुद तय करे।
  • यह कैसे काम करता है: सिस्टम एक मास्क (हाँ और ना वाले बॉक्स का एक ग्रिड) का उपयोग करता है।
    • समय (Temporal): आप कह सकते हैं, "पहले 2 सेकंड को बिल्कुल वैसा ही रखें जैसा मैंने रिकॉर्ड किया था, लेकिन बाकी को बदल दें।"
    • स्थान (Spatial): आप कह सकते हैं, "पैरों को ठीक वैसे ही हिलने दें जैसा मैंने रिकॉर्ड किया है, लेकिन नए हाथ के मूवमेंट बनाएं।"
    • यह इनपेंटिंग (Inpainting) (डांस के टूटे हुए हिस्से को ठीक करना), इन-बिटवीनिंग (In-betweening) (दो पोज़ के बीच के अंतर को भरना), और ट्रैजेक्टरी कंट्रोल (Trajectory Control) (डांसर को एक विशिष्ट पथ का पालन करने के लिए बनाना) की अनुमति देता है।

4. "म्यूजिक ट्रांसलेटर": कान (The Ear)

ताकि डांस बीट के साथ तालमेल बिठा सके, यह सिस्टम केवल संगीत को सुनता नहीं है; यह इसे गहराई से समझता है।

  • पेपर ने संगीत को "सुनने" के विभिन्न तरीकों का परीक्षण किया। उन्होंने पाया कि Jukebox (जो एक सुपर-स्मार्ट म्यूजिक AI की तरह है) का उपयोग करना सबसे अच्छा काम करता है। यह रोबोट को न केवल बीट, बल्कि गाने के "एहसास" को समझने में भी मदद करता है, ताकि डांस ड्रम बीट्स के साथ बिल्कुल सटीक बैठे।

यह एक बड़ी बात क्यों है?

  • यह लचीला है: आप एक ही प्रकार के डांस तक सीमित नहीं हैं। आप एक ही गाने के लिए "सैड बैले" या "हैप्पी हिप-हॉप" मांग सकते हैं, और यह तुरंत स्टाइल बदल देगा।
  • यह संपादन योग्य (Editable) है: यदि आपको एक डांस पसंद है लेकिन आप केवल हाथ के मूवमेंट्स को बदलना चाहते हैं, तो आप पूरे डांस को दोबारा जनरेट किए बिना ऐसा कर सकते हैं।
  • यह वास्तविक (Realistic) है: डांस स्वाभाविक दिखते हैं, जिसमें पैर जमीन पर सही से पड़ते हैं और मूवमेंट सुचारू रूप से चलते हैं, जिससे पुराना "ग्लिच वाला" लुक नहीं आता।

संक्षेप में

इस पेपर को एक वर्चुअल डांस पार्टनर बनाने के रूप में सोचें जो आपके संगीत को सुनता है, आपके मूड (स्टाइल) को समझता है, और आपके विशिष्ट निर्देशों (constraints) का पालन करता है, जबकि वह हर बार कोशिश करने पर बेहतर डांस करना सीखता है। यह AI डांस जनरेशन की अराजक प्रक्रिया को कलाकारों और गेम डिजाइनरों के लिए एक नियंत्रण योग्य, रचनात्मक उपकरण में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →