← नवीनतम पेपर
⚡ electrical engineering

MuPPet: Multi-person 2D-to-3D Pose Lifting

MuPPet एक नवीन मल्टी-पर्सन 2D-टू-3D पोज़ लिफ्टिंग फ्रेमवर्क है जो पर्सन एनकोडिंग, परम्यूटेशन ऑग्मेंटेशन और डायनेमिक मल्टी-पर्सन अटेंशन के माध्यम से अंतर-व्यक्तिगत सहसंबंधों को स्पष्ट रूप से मॉडल करता है, जिससे ग्रुप इंटरेक्शन डेटासेट्स पर स्टेट-ऑफ-द-आर्ट प्रदर्शन और ऑक्लूजन परिदृश्यों में बेहतर मजबूती प्राप्त होती है।

मूल लेखक: Thomas Markhorst, Zhi-Yi Lin, Jouh Yeong Chew, Jan van Gemert, Xucong Zhang

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thomas Markhorst, Zhi-Yi Lin, Jouh Yeong Chew, Jan van Gemert, Xucong Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त पार्टी में हैं। आप लोगों को चलते-फिरते, बातें करते और हंसते हुए देख सकते हैं। यदि आप कागज पर हर किसी के पोज़ का एक स्टिक-फिगर स्केच बनाना चाहें, तो वह 2D पोज़ एस्टीमेशन (2D pose estimation) होगा। यह दीवार पर बनी एक छाया की तरह सपाट है।

लेकिन पार्टी को वास्तव में समझने के लिए—यह जानने के लिए कि कौन किसके करीब खड़ा है, कौन फुसफुसाने के लिए झुक रहा है, या कौन किसी लंबे व्यक्ति के पीछे छिपा हुआ है—आपको एक 3D मॉडल की आवश्यकता है। आपको गहराई (depth), दूरी और कमरे में सटीक स्थिति जानने की आवश्यकता है। यह 3D पोज़ लिफ्टिंग (3D pose lifting) है: उस सपाट स्केच को एक 3D होलोग्राम में बदलना।

समस्या क्या है? मौजूदा "होलोग्राम बनाने वाले" समूहों वाली पार्टियों में खराब प्रदर्शन करते हैं। वे हर व्यक्ति के साथ ऐसा व्यवहार करते हैं जैसे वह अकेले किसी कमरे में हो, और इस तथ्य को नजरअंदाज कर देते हैं कि लोग आपस में बातचीत करते हैं, एक-दूसरे की नकल करते हैं, या एक-दूसरे के दृश्य को बाधित (block) करते हैं।

पेश है MuPPet (Multi-person 2D-to-3D Pose Lifting)। MuPPet को एक सुपर-स्मार्ट पार्टी फोटोग्राफर के रूप में सोचें जो न केवल व्यक्तियों को देखता है, बल्कि पूरे समूह की गतिशीलता (group dynamic) को भी समझता है।

यहाँ बताया गया है कि MuPPet कैसे काम करता है, सरल उपमाओं (analogies) के माध्यम से:

1. "ग्रुप चैट" बनाम "अकेली आवाज़" (The "Group Chat" vs. The "Solo Voice")

कल्पना कीजिए कि आप अनुमान लगाने की कोशिश कर रहे हैं कि एक व्यक्ति क्या कर रहा है जब वह आंशिक रूप से एक खंभे के पीछे छिपा हुआ है।

  • पुराने तरीके (अकेली आवाज़): वे छिपे हुए व्यक्ति को देखते हैं और कहते हैं, "मुझे हाथ नहीं दिख रहा, इसलिए मैं बस अंदाज़ा लगा लूंगा।" वे व्यक्ति को एक द्वीप (island) की तरह देखते हैं।
  • MuPPet (ग्रुप चैट): यह छिपे हुए व्यक्ति और अन्य सभी को देखता है। यह सोचता है, "खैर, उनके बाईं ओर वाला व्यक्ति झुक रहा है, और दाईं ओर वाला व्यक्ति हाथ हिला रहा है। समूहों के बीच होने वाली सामान्य बातचीत के आधार पर, छिपा हुआ व्यक्ति भी शायद हाथ हिला ही रहा होगा।"
  • जादू: MuPPet एक डायनामिक मल्टी-पर्सन अटेंशन (Dynamic Multi-Person Attention) तंत्र का उपयोग करता है। इसे एक "ग्रुप चैट" के रूप में समझें जहाँ हर व्यक्ति का डेटा दूसरे व्यक्ति के डेटा से बात कर रहा है। यदि एक व्यक्ति बाधित (blocked) है, तो सिस्टम आसपास के लोगों की "बातचीत" का उपयोग करके लुप्त हिस्सों को भरने के लिए करता है।

2. "नाम टैग" (The "Name Tags" - Person Encoding)

भीड़भाड़ वाले कमरे में, यदि आप केवल "बाईं ओर वाला व्यक्ति" कहते हैं, तो यह भ्रमित करने वाला हो सकता है यदि लोग हिलते हैं।

  • समस्या: पुराने AI मॉडल अक्सर भ्रमित हो जाते हैं कि समूह का आकार बदलने पर कौन सा जोड़ (joint) किस व्यक्ति का है।
  • समाधान: MuPPet हर व्यक्ति को एक डिजिटल नाम टैग (जिसे पर्सन एनकोडिंग कहा जाता है) देता है। भले ही कैमरा 3 लोग देखे, फिर 5 लोग, फिर 2 लोग, MuPPet जानता है कि कौन कौन है। यह केवल जोड़ों का एक समूह नहीं देखता; यह "एलिस का हाथ," "बॉब का पैर," और "चार्ली का सिर" देखता है। यह विशिष्ट लोगों के बीच विशिष्ट संबंधों को सीखने में सक्षम बनाता है।

3. "पत्तों को फेंटना" (The "Shuffling Deck" - Permutation Augmentation)

कल्पना कीजिए कि आप एक रोबोट को दोस्तों के समूह को समझने के लिए सिखा रहे हैं। यदि आप रोबोट को हर बार बिल्कुल उसी क्रम में खड़े दोस्तों को दिखाते हैं, तो रोबोट शायद क्रम को समझने के बजाय उसे रट लेगा।

  • तरीका: MuPPet प्रशिक्षण के दौरान परम्यूटेशन लर्निंग (Permutation Learning) नामक तकनीक का उपयोग करता है। यह डेटा में लोगों के क्रम को ताश के पत्तों की तरह बेतरतीब ढंग से बदल देता है।
  • यह क्यों काम करता है: यह AI को लोगों के बीच के संबंधों को सीखने के लिए मजबूर करता है, न कि केवल ग्रिड पर उनकी स्थितियों को। यह सीखता है कि "व्यक्ति A, व्यक्ति B से बात कर रहा है" चाहे व्यक्ति A को पहले या अंत में सूचीबद्ध किया गया हो। यह AI को अविश्वसनीय रूप से मजबूत और लचीला बनाता है।

4. "अनुमान लगाने का खेल" (The "Guessing Game" - Diffusion Process)

कभी-कभी, सभी सुरागों के बावजूद, एक पोज़ दिखने के कई तरीके हो सकते हैं (विशेष रूप से यदि कोई छिपा हुआ हो)।

  • पुराना तरीका: AI एक एकल अनुमान लगाता है। यदि वह गलत है, तो वह गलत है।
  • MuPPet का तरीका: यह एक अनुमान लगाने का खेल (एक डिफ्यूजन प्रोसेस का उपयोग करके) खेलता है। यह संभावनाओं के एक धुंधले, शोर भरे बादल (जैसे पुराने टीवी पर दिखने वाला स्टैटिक) से शुरू होता है। फिर, चरण-दर-चरण, यह अनुमान को "डीनॉइज़" (denoise) करता है, यानी बार-बार सुधार करता है।
  • परिणाम: एक जोखिम भरा अनुमान लगाने के बजाय, यह पोज़ के कई संभावित संस्करण उत्पन्न करता है और फिर सबसे सटीक 3D स्थिति खोजने के लिए उनका औसत निकालता है। यह 100 लोगों से रास्ता पूछने और सबसे अच्छे मार्ग तक पहुँचने के लिए उनके उत्तरों का औसत लेने जैसा है।

यह क्यों मायने रखता है?

पेपर दिखाता है कि MuPPet ओक्लूजन (occlusions) (जब लोग एक-दूसरे को रोकते हैं) को संभालने में बहुत बेहतर है।

  • वास्तविक दुनिया का उदाहरण: यदि आप दोस्तों के एक समूह को गेम खेलते हुए फिल्मा रहे हैं, और एक व्यक्ति दूसरे के पीछे छिपा हुआ है, तो एक सामान्य कैमरा छिपे हुए व्यक्ति का पीछा खो सकता है। MuPPet दिखाई देने वाले लोगों की गति का उपयोग यह "अनुमान" लगाने के लिए करता है कि छिपा हुआ व्यक्ति कहाँ है, जिससे 3D मॉडल पूर्ण और सटीक बना रहता है।

संक्षेप में

MuPPet एक नया AI सिस्टम है जो लोगों के समूहों के सपाट 2D वीडियो को सटीक 3D मॉडल में बदल देता है। यह निम्नलिखित तरीकों से करता है:

  1. खाली जगहों को भरने के लिए (केवल व्यक्तियों को ही नहीं बल्कि) समूह की बात सुनता है
  2. नाम टैग पहनता है ताकि वह कभी भी ट्रैक न खोए कि कौन कौन है।
  3. डेटा को फेंटता है ताकि मानवीय अंतःक्रिया के सामान्य नियमों को सीख सके।
  4. सबसे सटीक 3D स्थिति का अनुमान लगाने के लिए सुधार का खेल खेलता है

यह तकनीक उन रोबोटों के लिए एक बड़ा कदम है जिन्हें समूहों के साथ बातचीत करने, सामाजिक गतिशीलता का विश्लेषण करने, और वास्तविक आभासी दुनिया बनाने की आवश्यकता है जहाँ डिजिटल अवतार स्वाभाविक रूप से एक साथ चल सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →