← नवीनतम पेपर
💻 computer science

DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding

DiMo एक एकीकृत डिस्क्रीट डिफ्यूजन फ्रेमवर्क पेश करता है जो द्वि-दिशीय (bidirectional) टेक्स्ट-मोशन समझ और पीढ़ी के लिए मास्क्ड मॉडलिंग का विस्तार करता है, जो पुनरावृत्त टोकन रिफाइनमेंट (iterative token refinement), रेसिडुअल वेक्टर क्वांटाइजेशन (residual vector quantization) और ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (Group Relative Policy Optimization) के माध्यम से लचीले गुणवत्ता-विलंबता ट्रेड-ऑफ और विविध मोशन कार्यों को सक्षम बनाता है।

मूल लेखक: Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, जादुई स्केचबुक है। अतीत में, यदि आप किसी विवरण के आधार पर नाचते हुए व्यक्ति का चित्र बनाना चाहते थे, या किसी डांस वीडियो के आधार पर कहानी लिखना चाहते थे, तो आपको दो अलग-अलग स्केचबुक का उपयोग करना पड़ता था, या एक बहुत ही कठोर स्केचबुक का उपयोग करना पड़ता था जो केवल एक समय में एक ही स्ट्रोक (रेखा) बना सकती थी। यदि आप पहले स्ट्रोक में कोई गलती करते थे, तो पूरा चित्र बर्बाद हो जाता था और आप बिना दोबारा शुरू किए उसे आसानी से ठीक नहीं कर सकते थे।

DiMo एक नए प्रकार की "स्मार्ट स्केचबुक" है जो नियम बदल देती है। यह एक एकल प्रणाली है जो एक साथ दो काम कर सकती है:

  1. विवरण को पढ़ना और गति को चित्रित करना (Text-to-Motion)।
  2. गति को देखना और विवरण लिखना (Motion-to-Text)।

यह कैसे काम करता है, यहाँ कुछ रोजमर्रा के उदाहरणों के माध्यम से बताया गया है:

1. "धुंधली फोटो" का खेल (यह कैसे उत्पन्न करता है)

अधिकांश पुराने तरीके एक व्यक्ति की तरह काम करते हैं जो एक बार में एक शब्द लिखता है। एक बार जब वे एक शब्द लिख देते हैं, तो वे उसे बदल नहीं सकते। यदि वे लिखते हैं "कुत्ता दौड़ा," तो वे पूरे वाक्य को फिर से लिखे बिना "दौड़ा" को "कूदा" में आसानी से नहीं बदल सकते।

DiMo अलग तरह से काम करता है। कल्पना कीजिए कि आपके पास एक डांसर की फोटो है, लेकिन वह पूरी तरह से स्टैटिक शोर (जैसे धुंधली टीवी स्क्रीन) से ढकी हुई है।

  • प्रक्रिया: DiMo डांसर को स्ट्रोक-दर-स्ट्रोक नहीं बनाता है। इसके बजाय, यह एक बार में पूरी धुंधली तस्वीर को देखता है। यह अनुमान लगाता है कि डांसर कैसा दिखता है, फिर यह अनुमान लगाता है कि अगला संस्करण कैसा होना चाहिए, और बार-बार इसे परिष्कृत (refine) करता रहता है।
  • जादू: यह तस्वीर में कहीं भी गलतियों को तुरंत ठीक कर सकता है। यदि बायां हाथ अजीब लग रहा है, तो यह दाएं पैर को खराब किए बिना केवल बाएं हाथ को ठीक कर सकता है। यह एक धुंधली फोटो को तब तक साफ करने की तरह करता है जब तक कि वह एकदम स्पष्ट न हो जाए, जिसे "डिनोइजिंग" (denoising) कहा जाता है।

2. "गति बनाम गुणवत्ता" का डायल

क्योंकि DiMo चरणों में चित्र को परिष्कृत करता है, इसलिए आपको परिणाम की गति चुनने का विकल्प मिलता है।

  • जल्दी चाहिए? आप प्रक्रिया को जल्दी रोक सकते हैं (मान लीजिए, 5 चरणों के बाद)। डांसर थोड़ा कच्चा दिखेगा, लेकिन आपको तुरंत परिणाम मिल जाएगा।
  • परफेक्ट चाहिए? आप इसे अधिक चरणों के लिए चलने दे सकते हैं (मान लीजिए, 30 चरण)। डांसर अविश्वसनीय रूप से वास्तविक और सुचारू दिखेगा।
    यह एक कैमरे की तरह है जिसमें "गति बनाम गुणवत्ता" का डायल होता है। आप अपनी जरूरत के अनुसार इसे घुमा सकते हैं।

3. "हाई-डेफिनिशन" अनुवादक (RVQ)

डांसर को वास्तविक बनाने के लिए, DiMo एक विशेष उपकरण का उपयोग करता है जिसे रेसिडुअल वेक्टर क्वांटाइजेशन (RVQ) कहा जाता है।

  • उदाहरण: कल्पना कीजिए कि आप केवल 10 रंगों का उपयोग करके एक जटिल पेंटिंग का वर्णन करने की कोशिश कर रहे हैं। यह ब्लॉक जैसा और बदसूरत दिखेगा। अब कल्पना कीजिए कि आपके पास 1,000 रंगों का पैलेट है, लेकिन आप उनका उपयोग परतों (layers) में करते हैं। पहले, आप बड़े आकार (शरीर) बिछाते हैं, फिर आप मांसपेशियों को जोड़ते हैं, फिर बालों के रेशों जैसे सूक्ष्म विवरण जोड़ते हैं।
  • परिणाम: DiMo इस गति को इन परतों में तोड़ देता है। यह इसे "कोर्स" (बड़ी) गतिविधियों (जैसे चलना) और "फाइन" (सूक्ष्म) विवरणों (जैसे उंगली का फड़कना) को अलग-अलग कैप्चर करने की अनुमति देता है, जिससे बहुत अधिक सुचारू और वास्तविक एनिमेशन प्राप्त होता है।

4. "स्मार्ट कोच" (GRPO)

कभी-कभी, भले ही गति अच्छी दिख रही हो, लेकिन यह उस कहानी से मेल नहीं खा सकती जो आपने इसे दी है (उदाहरण के लिए, टेक्स्ट कहता है "बैकफ्लिप," लेकिन पात्र "चलता" है)।

  • उदाहरण: DiMo में एक अंतर्निहित "कोच" (जिसे GRPO कहा जाता है) है। DiMo द्वारा एक चाल चलने के बाद, कोच जांच करता है: "क्या यह टेक्स्ट से मेल खाता है?" यदि नहीं, तो कोच सिस्टम को फिर से प्रयास करने के लिए एक हल्का सा धक्का देता है। समय के साथ, DiMo कोच की बात बेहतर ढंग से सुनना सीख जाता है, जिससे यह सुनिश्चित होता है कि नृत्य कहानी से पूरी तरह मेल खाता है।

यह वास्तव में क्या कर सकता है?

पेपर के अनुसार, DiMo गति और टेक्स्ट के लिए एक स्विस आर्मी नाइफ (बहुउद्देशीय उपकरण) है:

  • टेक्स्ट से मोशन: आप टाइप करते हैं "एक व्यक्ति बैकफ्लिप कर रहा है," और यह वीडियो बना देता है।
  • मोशन से टेक्स्ट: आप एक डांस वीडियो अपलोड करते हैं, और यह "डांसर घूमता है और कूदता है" जैसा कैप्शन लिखता है।
  • गलतियाँ सुधारना: यदि आपके पास एक वीडियो है जिसमें कोई हिस्सा गायब है (जैसे बीच में एक कट), तो DiMo बिना किसी नए निर्देश के उस खाली हिस्से को भर सकता है।
  • कैप्शन सुधारना: यदि आपके पास एक वीडियो है और एक कैप्शन है जो पूरी तरह से मेल नहीं खाता, तो DiMo कैप्शन को ठीक कर सकता है ताकि वह वास्तव में जो हो रहा है उसका वर्णन कर सके।

निष्कर्ष

पेपर का दावा है कि DiMo पिछले तरीकों से बेहतर है क्योंकि यह शुरुआत में एक गलती करने में नहीं फंसता है। यह पूरी तस्वीर को देख सकता है, कहीं भी त्रुटियों को ठीक कर सकता है, और आपको यह चुनने देता है कि आप कितनी तेजी से या कितनी उच्च गुणवत्ता वाला परिणाम चाहते हैं। इसका परीक्षण मानक डेटासेट्स (HumanML3D और KIT-ML) पर किया गया है और यह दिखाता है कि यह एक ही एकीकृत ढांचे के भीतर उच्च-गुणवत्ता वाले नृत्य बना सकता है और सटीक विवरण लिख सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →