← नवीनतम पेपर
💻 computer science

MAMMA: Markerless & Automatic Multi-Person Motion Action Capture

यह शोध पत्र MAMMA को प्रस्तुत करता है, जो एक मार्करलेस मल्टी-पर्सन मोशन कैप्चर पाइपलाइन है जो परस्पर क्रिया करने वाले व्यक्तियों के मल्टी-व्यू वीडियो से सटीक रूप से SMPL-X पैरामीटर्स और डेंस 2D कॉन्टैक्ट-अवेयर लैंडमार्क्स को रिकवर करने के लिए एक नवीन क्वेरी-आधारित आर्किटेक्चर और एक बड़े सिंथेटिक डेटासेट का उपयोग करता है, जो बिना किसी व्यापक मैनुअल क्लीनअप के व्यावसायिक मार्कर-आधारित प्रणालियों के समान प्रतिस्पर्धी सटीकता प्राप्त करता है।

मूल लेखक: Hanz Cuevas-Velasquez, Anastasios Yiannakidis, Soyong Shin, Giorgio Becherini, Markus Höschle, Joachim Tesch, Taylor Obersat, Tsvetelina Alexiadis, Eni Halilaj, Michael J. Black

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanz Cuevas-Velasquez, Anastasios Yiannakidis, Soyong Shin, Giorgio Becherini, Markus Höschle, Joachim Tesch, Taylor Obersat, Tsvetelina Alexiadis, Eni Halilaj, Michael J. Black

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दो लोगों के बीच एक जटिल नृत्य (dance routine) को रिकॉर्ड करना चाहते हैं, जिसमें वे लगातार एक-दूसरे को गले लगा रहे हैं, घूम रहे हैं और छू रहे हैं।

पुराना तरीका (द "गोल्ड स्टैंडर्ड"):
पारंपरिक रूप से, इस तरह की सटीक 3D रिकॉर्डिंग पाने के लिए, आपको नर्तकों को दर्जनों छोटे, परावर्तक (reflective) बॉल्स वाले तंग सूट पहनाने होंगे। आपको महंगे कैमरों से भरे एक कमरे, हर एक बॉल को बिल्कुल सही जगह पर लगाने वाली तकनीशियरों की एक टीम, और फिर, गलतियों को ठीक करने के लिए घंटों मैन्युअल रूप से काम करने वाली एक एडिटर टीम की आवश्यकता होगी—जैसे कि कोई बॉल गिर गई हो या किसी हाथ के पीछे छिप गई हो। यह एक मास्टरपीस पेंट करने जैसा है, लेकिन पहले आपको कैनवास पर हजारों स्टिकर चिपकाने पड़ते हैं, और फिर उन स्टिकर्स को हटाने और पेंट को ठीक करने में कई दिन बिताने पड़ते हैं।

नया तरीका (MAMMA):
यह पेपर MAMMA (मार्करलेस एक्यूरेट मल्टी-पर्सन मोशन एक्विजिशन) पेश करता है। MAMMA को एक सुपर-स्मार्ट, जादुई चश्मे के रूप में समझें जो एक साधारण वीडियो को देखकर तुरंत उसके नीचे के अदृश्य कंकाल और त्वचा को "देख" सकता है, बिना किसी स्टिकर के।

यह कैसे काम करता है, इसे सरल उपमाओं (analogies) के साथ यहाँ समझाया गया है:

1. "अदृश्य बिंदु" की समस्या (The "Invisible Dot" Problem)

यदि आप कंप्यूटर से केवल यह अनुमान लगाने को कहते हैं कि वीडियो में किसी व्यक्ति की कोहनी कहाँ है, तो वह भ्रमित हो सकता है यदि दो लोग गले मिल रहे हों। उसे लग सकता है कि व्यक्ति A की कोहनी वास्तव में व्यक्ति B का कंधा है।

  • MAMM का समाधान: केवल कुछ जोड़ों (जैसे कोहनी और घुटने) का अनुमान लगाने के बजाय, MAMMA शरीर पर 512 छोटे, अदृश्य बिंदु प्रेडिक्ट करता है, जो एक हाई-रिज़ॉल्यूशन मेश (mesh) की तरह होते हैं।
  • जादुई ट्रिक: यह एक विशेष "क्वेरी" (query) सिस्टम का उपयोग करता है। कल्पना कीजिए कि आपके पास 512 छोटे जासूस हैं, और प्रत्येक को शरीर के एक विशिष्ट बिंदु (जैसे, "जासूस #42 बाईं छोटी उंगली के सिरे को ढूंढ रहा है") को खोजने के लिए सौंपा गया है। वे केवल इमेज को नहीं देखते; वे इमेज और एक "मास्क" (व्यक्ति की डिजिटल रूपरेखा) दोनों को देखते हैं ताकि उन्हें पता चल सके कि वे किसे ढूंढ रहे हैं। यह उन्हें लोगों के गले मिलने पर भ्रमित होने से रोकता है।

2. "स्पर्श" का अहसास (The "Contact" Sense)

जब दो लोग करीब से नाचते हैं, तो उनके शरीर आपस में टकराते हैं। पुराने मार्कर सिस्टम में, मार्कर अक्सर छिप जाते थे, और कंप्यूटर सोचता था कि लोग एक-दूसरे के आर-पार भूत की तरह जा रहे हैं (इसे "इंटरपेनेट्रेशन" की समस्या कहा जाता है)।

  • MAMMA का समाधान: MAMMA को टच-अवेयर (स्पर्श के प्रति जागरूक) होने के लिए प्रशिक्षित किया गया है। यह न केवल यह प्रेडिक्ट करता है कि एक बिंदु कहाँ है, बल्कि यह भी कि:
    • विजिबिलिटी (दृश्यता): "क्या यह बिंदु एक हाथ के पीछे छिपा है?"
    • कॉन्टैक्ट (संपर्क): "क्या यह बिंदु फर्श या दूसरे व्यक्ति को छू रहा है?"
  • उपमा: यह ऐसा है जैसे कंप्यूटर में स्पर्श की शक्ति हो। यदि वह देखता है कि दो लोग गले मिल रहे हैं, तो वह जानता है, "ठीक है, ये बिंदु छू रहे हैं, इसलिए वे कमरे के विपरीत दिशाओं में नहीं हो सकते।" यह 3D मॉडल्स को एक-दूसरे के अंदर घुसने (glitching) से रोकता है।

3. "ट्रेनिंग जिम" (The "Training Gym")

MAMMA को यह सिखाने के लिए कि यह कैसे किया जाए, शोधकर्ताओं को केवल असली लोगों को फिल्माने की आवश्यकता नहीं थी (क्योंकि असली लोगों को सटीक 3D डेटा के साथ फिल्माना कठिन है)।

  • समाधान: उन्होंने एक विशाल, हाइपर-रियलिस्टिक वीडियो गेम की दुनिया बनाई जिसे MammaSyn कहा जाता है। उन्होंने हजारों डिजिटल अवतारों को हर अजीब स्थिति में नाचने, लड़ने और गले मिलने के लिए प्रोग्राम किया। उन्होंने इन डिजिटल अवतारों को 32 अलग-अलग कैमरा एंगल से एक साथ फिल्माया।
  • यह क्यों महत्वपूर्ण है: क्योंकि यह एक वीडियो गेम है, वे हर एक बिंदु की सटीक सच्चाई जानते हैं। उन्होंने इस "परफेक्ट प्रैक्टिस" का उपयोग इस AI को प्रशिक्षित करने के लिए किया ताकि यह वास्तविक जीवन की अराजकता को संभाल सके।

4. परिणाम: "घोस्ट-फ्री" डांसिंग (The Result: "Ghost-Free" Dancing)

जब उन्होंने महंगे, मार्कर-आधारित सिस्टम (जैसे Vicon) के खिलाफ MAMMA का परीक्षण किया:

  • सटीकता (Accuracy): यह लगभग समान था। सटीकता में अंतर एक मानव बाल की चौड़ाई से भी कम (1 मिमी से कम) था।
  • गति (Speed): पुराने तरीके में एक सेशन को साफ करने में लगभग 72 घंटे का मानवीय श्रम लगता था। MAMMA इसे लगभग 26 घंटे के स्वचालित कंप्यूटर प्रोसेसिंग में कर देता है।
  • लागत (Cost): आपको $100,000 के कैमरों वाले कमरे की आवश्यकता नहीं है। आप इसे कुछ सिंक्रोनाइज्ड आईफोन्स (iPhones) के साथ कर सकते हैं।

निचोड़ (The Bottom Line)

MAMMA एक तरह से कंप्यूटर को एक साथ एक्स-रे विजन और स्पर्श की शक्ति देने जैसा है। यह हमें जटिल, अंतरंग मानवीय अंतःक्रियाओं (जैसे नृत्य या मार्शल आर्ट्स) को हॉलीवुड-स्तर की सटीकता के साथ कैप्चर करने की अनुमति देता है, लेकिन बिना उन महंगे सूटों, चिपचिपे मार्कर्स या घंटों के थकाऊ मैन्युअल काम के। यह मोशन कैप्चर का लोकतंत्रीकरण करता है, जिससे शोधकर्ताओं और रचनाकारों के लिए कहीं भी, कभी भी मानव गति को रिकॉर्ड करना संभव हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →