← नवीनतम पेपर
🤖 AI

EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion

EquiFusion एक परम्यूटेशन इक्विवैरिएंट लेटेंट डिफ्यूजन आर्किटेक्चर का उपयोग करने वाला पहला किनेमैटिक्स-अज्ञेय मानव गति भविष्यवाणी मॉडल पेश करता है जो कंकाल की कनेक्टिविटी को एक स्पष्ट इनपुट के रूप में मानता है, जिससे उत्कृष्ट क्रॉस-डेटासेट सामान्यीकरण, ज़ीरो-शॉट क्षमताएं, और पिछले तरीकों की तुलना में काफी अधिक दक्षता के साथ अत्याधुनिक प्रदर्शन सक्षम होता है।

मूल लेखक: Cecilia Curreli, Florian Hofherr, Dominik Muhle, Abhishek Saroha, Riccardo Marin, Daniel Cremers

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cecilia Curreli, Florian Hofherr, Dominik Muhle, Abhishek Saroha, Riccardo Marin, Daniel Cremers

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को डांस करना सिखाने की कोशिश कर रहे हैं। अतीत में, यदि आप चाहते थे कि रोबोट "हिप-हॉप" शैली सीख ले, तो आपको उसके लिए एक विशिष्ट मस्तिष्क (brain) बनाना पड़ता था। यदि फिर आप चाहते थे कि वह "बैले" (Ballet) सीखे, तो आपको एक पूरी तरह से नया मस्तिष्क बनाना पड़ता, या हिप-हॉप मस्तिष्क को तब तक खींचना और मरोड़ना पड़ता जब तक कि वह बैले मस्तिष्क जैसा न दिखने लगे। इस खींचने और मरोड़ने की प्रक्रिया को रिटारगेटिंग (retargeting) कहा जाता है, और यह पेपर तर्क देता है कि यह एक अव्यवस्थित, त्रुटिपूर्ण और डरावना अनुभव है जो रोबोट के संतुलन को बिगाड़ देता है।

EquiFusion के पीछे के शोधकर्ता कहते हैं: "एक डांस स्टाइल के लिए एक मस्तिष्क बनाना बंद करें।" उन्होंने पहला ऐसा रोबोट मस्तिष्क बनाया है जिसे इस बात से कोई फर्क नहीं पड़ता कि वह किस तरह के कंकाल (skeleton) को देख रहा है। चाहे उस कंकाल में 17 जोड़ हों, 22 जोड़ हों, या यदि कुछ जोड़ गायब भी हों (जैसे कि एक छिपा हुआ हाथ), यह नया मॉडल इन सभी को एक ही लचीले मन के साथ संभाल लेता है।

"जादुई" सामग्री: परम्यूटेशन इक्विवैरिएंट (Permutation Equivariance)

इसे समझने के लिए, कल्पना करें कि दोस्तों का एक समूह हाथ पकड़कर घेरे में खड़ा है। पुराने मॉडलों में, कंप्यूटर को यह याद रखना पड़ता था कि ठीक कौन कहाँ खड़ा है। यदि मित्र A, मित्र B की जगह पर चला जाता, तो कंप्यूटर भ्रमित हो जाता क्योंकि उसे प्रोग्राम किया गया था कि मित्र A एक विशिष्ट सीट पर होगा।

EquiFusion एक गणितीय ट्रिक का उपयोग करता है जिसे परम्यूटेशन इक्विवैरिएंट (permutation equivariance) कहा जाता है। इसे एक सार्वभौमिक अनुवादक (universal translator) की तरह समझें जो दोस्तों की विशिष्ट सीटों को नहीं, बल्कि उनके बीच के संबंधों को समझता है। इससे कोई फर्क नहीं पड़ता कि आप घेरे में दोस्तों का क्रम बदल देते हैं; मॉडल समझ जाता है कि "हाथ A, हाथ B को पकड़े हुए है", चाहे वे कहीं भी खड़े हों। यह मॉडल को किसी भी कंकाल पर, कहीं भी, गति के नियमों को एक बार सीखने और उन्हें लागू करने की अनुमति देता है, बिना हर नए शरीर के आकार के लिए पुन: प्रशिक्षित (retrain) हुए।

उन्होंने क्या खारिज किया

यह पेपर बहुत स्पष्ट है कि क्या काम नहीं करता है और वे किससे बच रहे हैं:

  • अब "रिटारगेटिंग" नहीं: वे स्पष्ट रूप से एक कंकाल प्रकार को दूसरे में बदलने (जैसे कि एक 17-जॉइंट कंकाल को 22-जॉइंट कंकाल में बदलना) की पुरानी पद्धति के विरुद्ध तर्क देते हैं। उन्होंने पाया कि यह त्रुटियां पेश करता है (जैसे कि नकली पैर जोड़ना जो डगमगाते हैं) और डेटा को एक अजीब वितरण (distribution) में बदल देता है जिसे मॉडल ने पहले नहीं देखा है।
  • कोई "जॉइंट-विशिष्ट" मस्तिष्क नहीं: वे प्रत्येक डेटासेट (जैसे Human3.6M, AMASS, या Nymeria) के लिए एक अलग नेटवर्क प्रशिक्षित करने के विचार को खारिज करते हैं। पेपर यह सिद्ध करता है कि ऐसे मॉडल जिनके वेट्स (weights) विशिष्ट जोड़ों की संख्या या प्रकार से बंधे होते हैं, वे नए, अनदेखे कंकालों पर सामान्यीकरण (generalize) नहीं कर सकते।
  • SMPL से कोई "मैजिक प्रायर्स" नहीं: वे पूर्व-मौजूदा 3D बॉडी मॉडल्स (जैसे SMPL) पर निर्भर नहीं हैं जिन्हें विशिष्ट मेश डेटा या स्किनिंग की आवश्यकता होती है, जो अक्सर वास्तविक दुनिया के मोशन कैप्चर डेटा में उपलब्ध नहीं होते हैं।

परिणाम: छोटे, तेज़ और स्मार्ट

लेखकों ने केवल अनुमान नहीं लगाया; उन्होंने सब कुछ मापा। उनके प्रयोगों ने क्या दिखाया:

  • ज़ीरो-शॉट मैजिक (Zero-Shot Magic): उन्होंने मॉडल का परीक्षण उन कंकालों पर किया जिन्हें उसने पहले कभी नहीं देखा था (जैसे कि 22 जोड़ों वाले AMASS पर प्रशिक्षण के बाद 17 जोड़ों वाला H36M डेटासेट)। मॉडल बिना किसी अतिरिक्त प्रशिक्षण के "आउट-ऑफ-द-बॉक्स" काम कर गया।
  • भारी दक्षता: क्योंकि यह सभी शरीरों के लिए एक ही मस्तिष्क का उपयोग करता है, इसलिए यह मॉडल अपने निकटतम प्रतिद्वंद्वी, SkelDiff की तुलना में 75% छोटा (पैरामीटर्स के मामले में) है। यह दोगुनी तेजी से प्रशिक्षित और चलता भी है।
  • बेहतर सटीकता: मानक परीक्षणों पर, इसने अत्याधुनिक (state-of-the-art) परिणाम प्राप्त किए। उदाहरण के लिए, H36M डेटासेट पर, इसने भविष्यवाणी त्रुटि (uADE) को घटाकर 7.86 सेमी कर दिया (SkelDiff के 10.81 सेमी की तुलना में, जिसे रिटारगेटिंग का उपयोग करना पड़ा था)।
  • गायब अंगों को संभालना: एक "ज़ीरो-शॉट" परीक्षण में जहाँ उन्होंने इनपुट के दौरान मॉडल से एक पूरा अंग (जैसे हाथ) छिपा दिया था, मॉडल शरीर के बाकी हिस्सों की भविष्य की गति की भविष्यवाणी काफी अच्छी तरह से कर सका, जबकि अन्य मॉडल विफल हो गए या उन्हें जटिल, मैनुअल सुधारों की आवश्यकता पड़ी।

वे कितने आश्वस्त हैं?

पेपर अपने इन निष्कर्षों में काफी आश्वस्त है क्योंकि उन्होंने इसे ठोस गणित और व्यापक प्रयोगों के साथ पुख्ता किया है।

  • सिद्ध गणित: उन्होंने एक गणितीय प्रमाण (लेम्मा 1 और थ्योरम 2) प्रदान किया कि किसी मॉडल को किसी भी आकार के कंकाल को संभालने के लिए, इसके वेट्स का जोड़ों की संख्या से स्वतंत्र होना अनिवार्य है। उन्होंने सिद्ध किया कि पिछले मॉडल इस नियम का उल्लंघन करते हैं, जबकि EquiFusion डिज़ाइन द्वारा इस नियम को संतुष्ट करता है।
  • मापा गया प्रदर्शन: उन्होंने केवल सिमुलेशन नहीं किया; उन्होंने विशाल वास्तविक दुनिया के डेटासेट्स (AMASS, Nymeria, Human3.6M) पर मॉडल को प्रशिक्षित किया और मौजूदा सर्वोत्तम विधियों के विरुद्ध परीक्षण किया। परिणामों ने सभी मेट्रिक्स में ज़ीरो-शॉट परिदृश्यों में कम से कम 25% का प्रदर्शन उछाल, और यथार्थवाद (realism) के मामले में 70% तक की वृद्धि दिखाई।
  • एक चेतावनी: लेखक एक छोटी सी सीमा का उल्लेख करते हैं: हालांकि मॉडल "लीफ" जॉइंट्स (जैसे हाथ के अंत में स्थित जोड़) को संभाल सकता है, लेकिन यदि एक मध्यवर्ती जोड़ गायब हो जाए लेकिन अंत मौजूद हो (उदाहरण के लिए, कोहनी गायब है लेकिन हाथ मौजूद है), तो इसे संघर्ष करना पड़ता है। वे सुझाव देते हैं कि यह भविष्य के कार्य के लिए एक खुला प्रश्न है।

संक्षेप में, EquiFusion सुझाव देता है कि अब हमें दुनिया को अपने मॉडलों के अनुरूप ढालने की आवश्यकता नहीं है। इसके बजाय, हम एक ऐसा मॉडल बना सकते हैं जो दुनिया के अनुकूल होने के लिए पर्याप्त लचीला हो, चाहे वह एक पूर्ण-शरीर वाला डांसर हो, एक आंशिक दृश्य हो, या एक पूरी तरह से नया कंकाल ढांचा हो जिसे हमने पहले कभी नहीं देखा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →