← नवीनतम पेपर
💻 computer science

RDM: Recurrent Diffusion Model for Human Motion Generation

यह शोध पत्र RDM का प्रस्ताव करता है, जो एक आवर्ती डिफ्यूजन मॉडल (recurrent diffusion model) है जो पिछले शोरयुक्त फ्रेमों (noisy frames) पर जनरेशन को अनुकूलित करने के लिए नॉर्मलाइजिंग फ्लो (Normalizing Flows) का लाभ उठाता है, जिससे टेक्स्ट प्रॉम्प्ट्स के साथ उच्च संरेखण बनाए रखते हुए कम कम्प्यूटेशनल लागत के साथ कुशल, दीर्घकालिक मानव गति संश्लेषण (human motion synthesis) सक्षम होता है।

मूल लेखक: Mirgahney Mohamed, Harry Jake Cunningham, Marc P. Deisenroth, Lourdes Agapito

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mirgahney Mohamed, Harry Jake Cunningham, Marc P. Deisenroth, Lourdes Agapito

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को किसी गाने पर नाचना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि रोबोट लंबे समय तक नाचता रहे, न कि केवल कुछ सेकंड के लिए, और आप चाहते हैं कि उसका हर मूव अगले मूव में स्वाभाविक रूप से घुल जाए, जैसे एक असली इंसान करता है।

यह चुनौती है जो पेपर "RDM: Recurrent Diffusion Model for Human Motion Generation" हल करता है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया।

समस्या: "फोटो एल्बम" बनाम "मूवी"

मानव गति (human motion) बनाने के लिए वर्तमान AI तरीके एक फोटो एल्बम बनाने जैसा है।

  • Volume Diffusion (पुराना तरीका): कल्पना कीजिए कि आप 1 मिनट का वीडियो बनाना चाहते हैं। पुराना AI एक ही बार में वीडियो के पूरे 60 सेकंड बनाने की कोशिश करता है, जैसे कि एक ही ब्रशस्ट्रोक में पूरी पेंटिंग बनाने की कोशिश करना।

    • दोष: यह बहुत अधिक बोझ महसूस करने लगता है। यह एक छोटा सा चौकोर हिस्सा (एक छोटा क्लिप) पेंट करने के बाद ही अपनी "दिमागी शक्ति" खो देता है। यदि आप इसे लंबा डांस बनाने के लिए कहते हैं, तो यह भ्रमित हो जाता है और डांसर के पैर टेलीपोर्ट होने लगते हैं या मोशन समझ से बाहर हो जाता है।
  • Autoregressive Diffusion ("स्टेप-बाय-स्टेप" तरीका): एक अन्य तरीका वीडियो को एक-एक सेकंड करके बनाने की कोशिश करता है। वह पहले सेकंड को पूरा करता है, उसे पूरी तरह से साफ (clean) करता है, फिर उस साफ सेकंड का उपयोग अगले को पेंट करने के लिए करता है।

    • दोष: यह अविश्वसनीय रूप से धीमा है। यह उस चित्रकार की तरह है जिसे हर एक स्ट्रोक के बाद अपना ब्रश धोना पड़ता है, उसे सुखाना पड़ता है, और अगले स्ट्रोक पर जाने से पहले कैनवास को पूरी तरह से साफ करना पड़ता है। एक लंबी मूवी बनाने में इसे बहुत समय लगता है।

समाधान: "कन्वेयर बेल्ट" (RDM)

लेखक RDM (Recurrent Diffusion Model) का प्रस्ताव देते हैं। इसे एक फैक्ट्री में कन्वेयर बेल्ट या एक रिले रेस की तरह समझें।

पूरी तस्वीर एक साथ बनाने या अगले हिस्से पर जाने से पहले पूरे कैनवास को साफ करने के बजाय, RDM कुछ स्मार्ट करता है:

  1. यह "गंदगी" (mess) को जीवित रखता है: जब AI डांस का अगला हिस्सा बनाता है, तो वह पिछले हिस्से के पूरी तरह से साफ होने का इंतज़ार नहीं करता। वह पिछले मूव के शोर वाले, बिखरे हुए (noisy/messy) वर्ज़न को देखता है।
  2. यह बैटन पास करता है: यह अगले मूव को जेनरेट करने के लिए उस बिखरे हुए पिछले मूव का उपयोग एक संकेत (hint) के रूप में करता है।
  3. जादुई ट्रिक (Normalizing Flows): यहाँ पेचीदा हिस्सा है। गणित में, एक "बिखरे हुए" संकेत को पास करना नियमों को तोड़ सकता है (जैसे कि एक कप से पानी को ऐसी बाल्टी में डालने की कोशिश करना जो मौजूद ही नहीं है)। इसे ठीक करने के लिए, लेखक Normalizing Flows नामक गणितीय उपकरण का उपयोग करते हैं।
    • उपमा: कल्पना कीजिए कि "बिखराव" (mess) कागज का एक मुड़ा हुआ टुकड़ा है। अगले स्टेशन पर बिना आकार खोए इसे पास करने के लिए, वे एक विशेष मशीन (Flow) का उपयोग करते हैं जो कागज को बिना फटे पूरी तरह से खोलने और फिर से मोड़ने में सक्षम है। यह सुनिश्चित करता है कि स्टेप्स को स्किप करने के दौरान भी गणित सही बना रहे।

यह एक बड़ी बात क्यों है?

1. अनंत नृत्य (Horizon Agnostic)
क्योंकि RDM बैटन को इतनी कुशलता से पास करता है, यह हमेशा के लिए नाच सकता है। आप इसे कह सकते हैं, "10 मिनट तक बास्केटबॉल ड्रिबल करो," और यह चलता रहेगा बिना डांसर के पैर फंसे या मोशन बिगड़े। पुराने तरीके कुछ ही सेकंड में क्रैश हो जाते।

2. मूवी की गति बढ़ाना
पुराने "स्टेप-बाय-स्टेप" तरीकों को अगले हिस्से की शूटिंग शुरू करने से पहले हर फ्रेम को पूरी तरह से साफ करना पड़ता था। RDM एक ऐसे निर्देशक की तरह है जो कहता है, "हे, हमें अगले सीन की शूटिंग शुरू करने से पहले पिछले सीन के बैकग्राउंड को परफेक्ट करने की ज़रूरत नहीं है; हम अगले सीन की शूटिंग करते समय बैकग्राउंड को ठीक कर सकते हैं।"

  • परिणाम: यह गणना के एक बड़े हिस्से को छोड़ देता है। पेपर दिखाता है कि यह पिछले सबसे अच्छे तरीकों की तुलना में 3 से 18 गुना तेज़ है।

3. बेहतर तालमेल (Alignment)
चूंकि यह लगातार पिछले मूव के "शोर वाले" (noisy) वर्ज़न को देखता है, इसलिए यह मूल निर्देश (text prompt) के साथ बहुत अधिक जुड़ा रहता है।

  • उदाहरण: यदि आप कहते हैं "बास्केटबॉल ड्रिबल करो," तो पुराने तरीके शायद ड्रिबलिंग शुरू करें, फिर अचानक गेंद गायब हो जाए, या व्यक्ति चलने लगे। RDM ड्रिबलिंग की लय को लंबे समय तक स्थिर रखता है।

सारांश उपमा: कहानीकार (The Storyteller)

  • Volume Diffusion एक ऐसे कहानीकार की तरह है जो पूरी किताब को याद करने और उसे एक ही बार में सुनाने की कोशिश करता है। अगर कहानी बहुत लंबी हो जाए, तो वह अंत भूल जाता है।
  • Autoregressive Diffusion एक ऐसे कहानीकार की तरह है जो एक वाक्य बोलता है, उसे पूरी तरह लिखता है, ड्राफ्ट मिटाता है, और फिर अगला वाक्य बोलता है। यह सटीक है लेकिन इसमें बहुत समय लगता है।
  • RDM एक ऐसे कहानीकार की तरह है जो एक वाक्य बोलता है, अपने हाथ में रफ ड्राफ्ट रखता है, और तुरंत अगला वाक्य बोलने के लिए उस रफ ड्राफ्ट की भावना (feeling) का उपयोग करता है। वह अतीत को परफेक्ट बनाने का इंतज़ार नहीं करता; वह भविष्य को ईंधन देने के लिए अतीत का उपयोग करता है।

संक्षेप में: RDM मोशन के "प्रवाह" (flow) को जीवित रखकर लंबे, सुचारू और यथार्थवादी मानव मूवमेंट जेनरेट करने का एक नया तरीका है, जो इसे पहले से कहीं अधिक तेज़ और बहुत लंबे सीक्वेंस बनाने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →