← नवीनतम पेपर
📊 statistics

Riemannian Motion Generation: A Unified Framework for Human Motion Representation and Generation via Riemannian Flow Matching

यह शोधपत्र रिमानियन मोशन जनरेशन (RMG) प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो स्केल-फ्री प्रतिनिधित्व के लिए अंतर्निहित ज्यामितीय गुणों और स्थिर गतिशीलता का लाभ उठाने के लिए प्रोडक्ट मैनिफोल्ड पर रिमानियन फ्लो मैचिंग का उपयोग करके मानव गति को मॉडल करता है ताकि अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Fangran Miao, Jian Huang, Ting Li

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fangran Miao, Jian Huang, Ting Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Riemannian Motion Generation" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

मुख्य विचार: एक ग्रिड पर नहीं, बल्कि एक गोले (Sphere) पर नृत्य करना

कल्पना कीजिए कि आप एक रोबोट को नृत्य करना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका (Euclidean Space):
पिछले अधिकांश तरीकों ने रोबोट को यह सिखाया कि मानव शरीर को एक सपाट, अनंत स्प्रेडशीट में संख्याओं के ग्रिड की तरह माना जाए। उन्होंने रोबोट को बताया: "बाएं पैर को 3.4 इंच दाईं ओर ले जाओ, फिर 1.2 इंच ऊपर।"

समस्या क्या थी? मानव शरीर सपाट ग्रिड नहीं होते। वे जोड़ों (joints) के साथ घूमने वाली सांधिक मशीनें (articulated machines) हैं। यदि आप घूमती हुई बांह को ग्रिड पर एक सीधी रेखा की तरह मानते हैं, तो गणित जटिल हो जाता है। रोबोट दीवार के आर-पार "चलने" की कोशिश कर सकता है या अपने अंग को एक असंभव आकार में मरोड़ सकता है क्योंकि ग्रिड यह नहीं समझता कि एक जोड़ केवल घूम सकता है, खिंच (stretch) नहीं सकता। इसे ठीक करने के लिए, कंप्यूटर को लगातार रोबोट की "पुलिसिंग" करनी पड़ती है, उसे कहना पड़ता है, "नहीं, यह शारीरिक रूप से असंभव है, इसे ठीक करो!" यह धीमा है और अक्सर झटकेदार, अप्राकृतिक गतिविधियों का कारण बनता है।

नया तरीका (Riemannian Motion Generation):
यह पेपर एक स्मार्ट तरीका प्रस्तावित करता है: शरीर को ग्रिड की तरह मानना बंद करें। इसे एक ग्लोब (globe) की तरह मानें।

लेखकों ने महसूस किया कि मानव गति स्वाभाविक रूप से एक विशिष्ट आकार (एक "मैनिफोल्ड") पर रहती है जहाँ घूमने और हिलने के नियम पहले से बने होते हैं। रोबोट को भौतिकी के नियम सीखने के लिए मजबूर करने के बजाय, उन्होंने रोबोट के मस्तिष्क को पहले दिन से ही भौतिकी के नियमों के भीतर रहने के लिए बनाया।

मुख्य अवधारणाओं की व्याख्या

1. "प्रोडक्ट मैनिफोल्ड" (LEGO सेट बनाम सूप)

कल्पना कीजिए कि आपके पास सूप का एक बाल्टी है (सभी शरीर के अंगों का एक मिला-जुला मिश्रण)। पिछले तरीकों ने पूरे सूप को एक साथ चखकर उसकी रेसिपी सीखने की कोशिश की।

यह पेपर सूप को उसके अवयवों (ingredients) में तोड़ने का सुझाव देता है: अनुवाद/स्थानांतरण (Translation) (फर्श पर आगे बढ़ना), घूर्णन (Rotation) (कूल्हों को घुमाना), और जोड़ों के कोण (Joint Angles) (घुटनों को मोड़ना)।

  • उपमा: एक LEGO सेट के बारे में सोचें। आप ईंटों को बेतरतीब ढंग से नहीं चिपकाते। आप उन्हें विशिष्ट तरीकों से एक साथ जोड़ते हैं।
  • नवाचार: लेखकों ने एक ऐसा सिस्टम बनाया जहाँ "आगे बढ़ना" एक सपाट फर्श (Euclidean space) पर रहता है, लेकिन "घूमना" एक गोले (sphere) पर रहता है (क्योंकि आप 360 डिग्री घूम सकते हैं, लेकिन बिना रीसेट किए 361 डिग्री नहीं घूम सकते)। इन अवयवों को अलग करके और रोबोट को प्रत्येक के लिए विशिष्ट नियम सिखाकर, यह सिस्टम बहुत अधिक कुशल हो जाता है।

2. Riemannian Flow Matching (सबसे छोटा रास्ता)

रोबोट "स्थिर खड़े होने" की मुद्रा से "कूदने" की मुद्रा तक कैसे पहुंचना सीखता है?

  • पुराना तरीका: रोबोट ज़िग-ज़ैग रेखा में चलने की कोशिश कर सकता है या दीवार के माध्यम से चक्कर लगा सकता है क्योंकि वह केवल सपाट निर्देशांकों (coordinates) के आधार पर अनुमान लगा रहा है।
  • नया तरीका (Geodesics): लेखक Geodesics की अवधारणा का उपयोग करते हैं। कल्पना कीजिए कि आप एक बास्केटबॉल पर चलने वाली चींटी हैं। दो बिंदुओं के बीच का सबसे छोटा रास्ता गेंद के माध्यम से एक सीधी रेखा नहीं है (जो असंभव है); यह सतह के साथ एक वक्र (curve) है।
  • जादू: रोबत स्वाभाविक रूप से इन "वक्राकार सबसे छोटे रास्तों" का पालन करना सीखता है। उसे यह बताने की ज़रूरत नहीं है कि "हड्डी को मत तोड़ो"; गोले का गणित यह सुनिश्चित करता है कि अंग जुड़ा रहे और सही ढंग से घूमे।

3. "स्केल-फ्री" लाभ (अब कोई रूलर नहीं)

पुराने तरीकों में, यदि आपने रोबोट को एक लंबे बास्केटबॉल खिलाड़ी पर प्रशिक्षित किया, तो वह एक छोटे बच्चे को एनिमेट करने में भ्रमित हो जाता। "ऊंचाई" के लिए संख्याएँ बहुत बड़ी या बहुत छोटी थीं।

  • नया तरीका: क्योंकि वे "प्री-शेप स्पेस" नामक एक गणितीय आकार का उपयोग करते हैं, सिस्टम स्वचालित रूप से आकार को अनदेखा कर देता है। यह केवल मुद्रा के आकार (shape) की परवाह करता है। यह एक बच्चे के चेहरे पर मुस्कान और एक विशालकाय के चेहरे पर मुस्कान को पहचानने जैसा है। यह सिस्टम को बहुत अधिक स्थिर और प्रशिक्षित करने में आसान बनाता है।

परिणाम: यह क्यों मायने रखता है?

लेखकों ने इस नए सिस्टम का परीक्षण दो बड़े डांस डेटासेट्स (HumanML3D और MotionMillion) पर किया।

  • यथार्थवाद (Realism): उत्पन्न गतियाँ अधिक सुचारू और वास्तविक हैं। रोबोट "ग्लिच" नहीं करता या अपने अंगों को असंभव कोणों में नहीं मरोड़ता।
  • दक्षता (Efficiency): यह तेजी से सीखता है और गतियों को वैध बनाए रखने के लिए कम "पुलिसिंग" की आवश्यकता होती है।
  • स्केलेबिलिटी (Scalability): यह छोटे डेटासेट्स के समान ही बड़े डेटासेट्स (लाखों क्लिप्स) पर भी उतना ही अच्छा काम करता है, जो यह साबित करता है कि यह ज्यामितीय दृष्टिकोण गति निर्माण का भविष्य है।

निचोड़

इस पेपर को रोबोट के ऑपरेटिंग सिस्टम को अपग्रेड करने के रूप में देखें।

  • पुराना OS: "X, Y, Z निर्देशांक हिलाओ। यदि आप भौतिकी तोड़ते हैं, तो फिर से प्रयास करें।"
  • नया OS (RMG): "आप घूर्णन के एक गोले और गति के एक फर्श पर रहते हैं। यहाँ वे प्राकृतिक पथ हैं जिन्हें आप ले सकते हैं। बस वक्र का अनुसरण करें।"

मानव शरीर की प्राकृतिक ज्यामिति का सम्मान करके, AI उच्च-गुणवत्ता वाली, यथार्थवादी मानव गति उत्पन्न कर सकता है जो केवल चलती हुई संख्याओं का संग्रह नहीं, बल्कि जीवंत महसूस होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →