← नवीनतम पेपर
💻 computer science

From Diffusion To Flow: Efficient Motion Generation In MotionGPT3

यह शोध पत्र MotionGPT3 फ्रेमवर्क के भीतर एक नियंत्रित अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि डिफ्यूजन उद्देश्यों (diffusion objectives) को रेक्टिफाइड फ्लो (rectified flow) से बदलने से HumanML3D डेटासेट पर मोशन जनरेशन की गुणवत्ता को बनाए रखते हुए या उसमें सुधार करते हुए प्रशिक्षण अभिसरण (training convergence) और अनुमान दक्षता (inference efficiency) में महत्वपूर्ण सुधार होता है।

मूल लेखक: Jaymin Ban, JiHong Jeon, SangYeop Jeong

प्रकाशित 2026-03-31
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jaymin Ban, JiHong Jeon, SangYeop Jeong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को "एक आनंदमय उछल-कूद" (a joyful skip) जैसे टेक्स्ट विवरण के आधार पर नृत्य करना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, ऐसा करने का सबसे अच्छा तरीका डिफ्यूजन (Diffusion) नामक एक विधि था।

डिफ्यूजन को एक मूर्तिकार की तरह समझें जो शोर (noise) और स्टैटिक से भरी मिट्टी के एक ब्लॉक से एक मूर्ति उकेरने की कोशिश कर रहा है। मूर्तिकार एक पूरी तरह से रैंडम, बिखरे हुए ब्लॉक (शोर) से शुरुआत करता है और धीरे-धीरे शोर को हटाता जाता है, इस उम्मीद में कि 100 या 1,000 छोटी-छोटी छेनी चलाने के बाद, एक आदर्श नर्तक उभर कर आएगा। यह अच्छा काम करता है, लेकिन यह धीमा है, और यदि आप बहुत जल्दी छेनी चलाना बंद कर देते हैं, तो आपको केवल मिट्टी का एक ढेर ही मिलेगा।

यह शोध पत्र, जिसका शीर्षक "From Diffusion to Flow" है, एक सरल प्रश्न पूछता है: क्या उस मूर्ति तक पहुँचने का कोई तेज़, अधिक सुगम तरीका है?

लेखक कहते हैं, "हाँ! चलिए रेक्टिफाइड फ्लो (Rectified Flow) को आजमाते हैं।"

नया दृष्टिकोण: "सीधी रेखा" बनाम "टेढ़ा-मेढ़ा रास्ता"

शोर को धीरे-धीरे हटाने के बजाय, रेक्टिफाइड फ्लो एक खाली कागज से सीधे तैयार मूर्ति तक एक सीधी रेखा खींचने जैसा है।

  • पुराना तरीका (Diffusion): कल्पना कीजिए कि आप आँखों पर पट्टी बांधकर अपने घर से पार्क तक जाने की कोशिश कर रहे हैं। आप एक कदम लेते हैं, भ्रमित होते हैं, फिर एक और कदम लेते हैं, फिर भ्रमित होते हैं। आपको वहाँ पहुँचने के लिए 100 छोटे, डगमगाते कदम उठाने पड़ते हैं।
  • नया तरीका (Flow): कल्पना कीजिए कि आपको एक जीपीएस (GPS) दिया गया है जो आपके घर से पार्क तक एक बिल्कुल सीधी, सीधी हाईवे बनाता है। आप बस सीधे वहां तक गाड़ी चलाते हैं। आप वहां पहुँचने के लिए केवल 4 या 5 कदमों की आवश्यकता महसूस कर सकते हैं।

उन्होंने क्या किया?

शोधकर्ताओं ने एक प्रसिद्ध रोबोट-डांसिंग एआई MotionGPT3 (जो वर्तमान में "शोर हटाने वाले" डिफ्यूजन तरीके का उपयोग करता है) को लिया और उसके मस्तिष्क को "सीधी रेखा" वाले फ्लो तरीके से बदल दिया। उन्होंने सब कुछ बिल्कुल वैसा ही रखा—रोबोट का शरीर, उसकी भाषा की समझ, और उसके डांस मूव्स—ताकि वे देख सकें कि क्या सीखने की विधि से कोई अंतर पड़ता है।

उन्होंने इसका परीक्षण HumanML3D पर किया, जो मानव नृत्य की गतिविधियों और उनके टेक्स्ट विवरणों का एक विशाल संग्रह है।

परिणाम: तेज़, सुगम और उतना ही अच्छा

यहाँ हुआ जब उन्होंने "सीधी रेखा" (Flow) पद्धति को अपनाया:

  1. इसने तेजी से सीखा: फ्लो रोबोट ने लगभग 54 प्रशिक्षण सत्रों (epochs) में पूरी तरह से नृत्य करना सीख लिया। डिफ्यूजन रोबोट को उसी स्तर तक पहुँचने के लिए 143 सत्रों की आवश्यकता थी। यह ऐसा है जैसे फ्लो रोबोट ने दो सप्ताह में एक समर कैंप में महारत हासिल कर ली, जबकि डिफ्यूजन रोबोट को पूरा सेमेस्टर लग गया।
  2. यह उतना ही अच्छा है (या बेहतर है): एक बार प्रशिक्षित होने के बाद, फ्लो रोबोट उतना ही अच्छा नृत्य करता है जितना कि डिफ्यूजन रोबोट। वास्तव में, यह टेक्स्ट विवरण और डांस मूव्स के मिलान में थोड़ा बेहतर था।
  3. यह चलाने में बहुत तेज़ है: यह सबसे बड़ी बात है। जब आप रोबोट को अभी नृत्य करने के लिए कहते हैं:
    • डिफ्यूजन रोबोट को चाल समझने के लिए लगभग 8 से 10 छोटे कदम लेने पड़ते हैं।
    • फ्लो रोबोट को केवल 4 कदमों की आवश्यकता होती है।
    • कम कदम लेने के कारण, फ्लो रोबोट नृत्य को 15-20% तेज़ी से जनरेट करता है।

यह क्यों मायने रखता है?

डिफ्यूजन पद्धति को एक बहुत ही सावधान, धीमे कलाकार के रूप में सोचें जिसे सही करने के लिए बहुत समय चाहिए। फ्लो पद्धति एक कुशल स्प्रिंटर (धावक) की तरह है जो रास्ता जानता है और बिना गुणवत्ता खोए जल्दी वहां पहुँच जाता है।

वीडियो गेम, वर्चुअल रियलिटी, या उन रोबोटों के लिए जिन्हें आपकी आवाज़ के कमांड पर तुरंत प्रतिक्रिया देने की आवश्यकता होती है, "धीमे कलाकार" के शोर को हटाने के खत्म होने का इंतज़ार करना बहुत लंबा समय है। "स्प्रिंटर" (Flow) तत्काल मोशन जनरेशन के लिए संभव बनाता है।

मुख्य निष्कर्ष

यह शोध पत्र सिद्ध करता है कि महान रोबोट नृत्य बनाने के लिए आपको धीमी, शोर भरी "छेनी चलाने वाली" प्रक्रिया की आवश्यकता नहीं है। "सीधी रेखा" वाले दृष्टिकोण (रेक्टified flow) को अपनाकर, आप उतने ही अच्छे (या बेहतर) नृत्य प्राप्त कर सकते हैं, लेकिन आपका एआई दोगुना तेज़ी से सीखता है और आधे समय में उन्हें जनरेट करता है।

यह दक्षता की जीत है: कम इंतज़ार, अधिक नृत्य।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →