Sound-based Multi-Person 3D Pose Estimation
यह शोध पत्र SoundMHPE को प्रस्तुत करता है, जो सिग्नल सुपरपोजिशन और रिफ्लेक्शन जैसी चुनौतियों से निपटने के लिए एक नवीन एनकोडर-डिकोडर आर्किटेक्चर का उपयोग करके, केवल ध्वनिक संकेतों (acoustic signals) से मल्टी-पर्सन 3D पोज़ का अनुमान लगाने वाला पहला फ्रेमवर्क है, जिसे एक नए निर्मित 6-घंटे के सिंक्रोनाइज़्ड डेटासेट पर सत्यापित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
द दशकों से, वैज्ञानिक अदृश्य को देखने के तरीके खोजने का प्रयास कर रहे हैं, ऐसी तकनीकें विकसित कर रहे हैं जो मानव आँख पर निर्भर हुए बिना मानव गति को ट्रैक कर सकें। कैमरे, जो प्रकाश पर निर्भर होते हैं, अंधेरे में या जब कोई व्यक्ति दीवार के पीछे छिपा हो, तो विफल हो जाते हैं। रेडियो तरंगें, जिनका उपयोग कुछ सेंसिंग सिस्टम में किया जाता है, पानी या धातु से टकराने पर संघर्ष करती हैं। इन जटिल, वास्तविक दुनिया के परिदृश्यों में, एक अलग प्रकार का संकेत एक आशाजनक विकल्प के रूप में उभरा है: ध्वनि। एक ध्वनि स्पंद (पल्स) को सक्रिय रूप से भेजकर और यह ध्यान से सुनकर कि वह वापस कैसे टकराती है, शोधकर्ता कमरे में वस्तुओं के आकार और स्थिति का मानचित्रण कर सकते हैं। इस तकनीक को 'एक्टिव एकोस्टिक सेंसिंग' कहा जाता है, और इसने पहले ही यह दिखा दिया है कि यह एक अकेले व्यक्ति की मुद्रा (पोश्चर) निर्धारित कर सकती है, भले ही वह छिपी हुई हो। हालाँकि, इस क्षेत्र में एक महत्वपूर्ण अंतर बना हुआ था। जबकि एक अकेली आवाज़ या गति एक विशिष्ट गूँज पैदा करती है, कई लोगों से भरे कमरे में ओवरलैपिंग ध्वनियों का एक अराजक मिश्रण बन जाता है। प्रत्येक व्यक्ति कहाँ खड़ा है और वह कैसे चल रहा है, इसे समझने के लिए इन संकेतों को सुलझाना लगभग असंभव माना जाता था, क्योंकि एक व्यक्ति से आने वाली गूँज दूसरे की गूँज के साथ बिना पहचाने मिल जाती है।
केइयो यूनिवर्सिटी, टोक्यो यूनिवर्सिटी ऑफ साइंस और NTT के शोधकर्ताओं की एक टीम ने अब इस समस्या को हल करने की दिशा में पहला कदम उठाया है। उन्होंने केवल ध्वनि का उपयोग करके कई लोगों की त्रि-आयामी (3D) मुद्राओं का अनुमान लगाने में सक्षम प्रणाली विकसित की है। शोधकर्ताओं ने अपने सिस्टम को प्रशिक्षित करने के लिए एक कस्टम डेटासेट बनाया, जिसमें एक कमरे में एक साथ तीन लोगों तक के हिलने-डुलने के छह घंटे के सिंक्रोनाइज़्ड ऑडियो और मोशन डेटा को रिकॉर्ड किया गया। इस सेटअप में दो स्पीकर एक विशिष्ट ध्वनि संकेत उत्सर्जित कर रहे थे और एक विशेष माइक्रोफोन था जो सभी दिशाओं से ध्वनि को पकड़ने में सक्षम था। जैसे-जैसे प्रतिभागियों ने चलना, मुड़ना और अपने हाथ उठाना शुरू किया, सिस्टम ने वापस आने वाली गूँज को रिकॉर्ड किया। चुनौती अत्यधिक थी; ध्वनिक संकेत कई अलग-अलग गतिविधियों का सुपरपोजिशन (अध्यारोपण) थे, जो इस बात से और अधिक जटिल हो गए कि ध्वनि शरीर और दीवारों से कैसे टकराती है, जिससे देरी उत्पन्न होती है जो एक विशिष्ट मुद्रा और एक विशिष्ट ध्वनि परिवर्तन के बीच के सीधे संबंध को धुंधला कर देती है।
इस जटिलता से निपटने के लिए, टीम ने एक नया ढांचा बनाया जिसे वे 'साउंडMHPE' कहते हैं। ध्वनि को एक एकल, अव्यवस्थित ब्लॉक के रूप में संसाधित करने के बजाय, उनका सिस्टम ऑडियो को विवरण की कई परतों में तोड़ देता है। यह ध्वनि का विश्लेषण विभिन्न समय खिड़कियों (टाइम विंडोज़) का उपयोग करके करता है, जो एक सेकंड के अंश में होने वाले तीव्र परिवर्तनों और ध्वनि की आवृत्ति में होने वाले धीमे, सूक्ष्म विवरणों, दोनों को देखता है। यह सिस्टम को उन सूक्ष्म ध्वनिक हस्ताक्षरों (सिग्नेचर) को अलग करने की अनुमति देता है जो शोर में खो सकते थे। एक बार ध्वनि का विश्लेषण हो जाने के बाद, सिस्टम लोगों को अलग करने के लिए एक परिष्कृत विधि का उपयोग करता है। यह प्रत्येक व्यक्ति को एक विशिष्ट सेट डिजिटल "क्वेरीज़" (प्रश्नों) को सौंपता है, जिससे सॉफ्टवेयर एक व्यक्ति की गतिविधियों के टेम्पोरल विकास को ट्रैक करने के साथ-साथ यह भी समझ पाता है कि वे कमरे में अन्य लोगों के साथ कैसे इंटरैक्ट करते हैं। यह दृष्टिकोण ओवरलैपिंग जानकारी को सुलझा देता है, जिससे सिस्टम को फ्रेम-दर-फ्रेम प्रत्येक व्यक्ति की मुद्रा को पुनर्गठित करने में सक्षम बनाता है।
इस कार्य के परिणाम दर्शाते हैं कि यह सिस्टम काम करता है। जब इसे मौजूदा तरीकों के विरुद्ध परखा गया, जो मूल रूप से सिंगल-पर्सन ट्रैकिंग के लिए डिज़ाइन किए गए थे या रेडियो-वेव सेंसिंग से अनुकूलित किए गए थे, तो नई ध्वनि-आधारित प्रणाली अधिक सटीक सिद्ध हुई। इसने जटिल गतिविधियों को सफलतापूर्वक ट्रैक किया, जैसे कि एक व्यक्ति का शरीर मोड़ना या दोनों हाथ उठाना, यहाँ तक कि अन्य चलते हुए व्यक्तियों के साथ होने पर भी। दो और तीन लोगों वाले परीक्षणों में, सिस्टम ने उच्च स्तर की सटीकता बनाए रखी, और अनुमानित तथा वास्तविक जोड़ों की स्थिति के बीच की दूरी को मापने में बेसलाइन मॉडल से बेहतर प्रदर्शन किया। शोधकर्ताओं ने यह भी पाया कि उनकी विधि अज्ञात वातावरण के अनुकूल हो सकती है; जब उन्होंने कमरे में विभाजन (पार्टीशन) रखे ताकि ध्वनि के परावर्तन को बदला जा सके, तब भी सिस्टम ने मोटे तौर पर मुद्रा का अनुमान लगाने में सफलता प्राप्त की, जो यह सुझाव देता है कि यह विभिन्न ध्वनिक स्थितियों को संभाल सकता है। इसके अलावा, उनके सिस्टम के अंतर्निहित तर्क को रेडियो फ्रीक्वेंसी डेटा पर लागू करने पर भी प्रभावी पाया गया, जो दर्शाता है कि यह दृष्टिकोण विभिन्न प्रकार के संकेतों के लिए मजबूत है।
यह शोध ध्वनिक संवेदन (एकोस्टिक सेंसिंग) की संभावनाओं के विस्तार को चिह्नित करता है। एकल-व्यक्ति परिदृश्यों से बहु-व्यक्ति वातावरण की ओर बढ़ते हुए, टीम ने भीड़भाड़ वाले स्थानों, आपदा राहत और खेल विश्लेषण के लिए अनुप्रयोगों के द्वार खोल दिए हैं जहाँ कैमरों का उपयोग नहीं किया जा सकता है या जहाँ रेडियो सिग्नल बाधित हो सकते हैं। हालांकि यह तकनीक अभी अपने शुरुआती चरणों में है और वास्तविक दुनिया में तैनात करने के लिए और अधिक विकास की आवश्यकता है, इस नए डेटासेट का निर्माण और मल्टी-पर्सन एस्टिमेशन पद्धति का सत्यापन एक महत्वपूर्ण आधार प्रदान करता है। यह कार्य पुष्टि करता है कि ध्वनि, जब सही उपकरणों के साथ विश्लेषण की जाती है, तो लोगों के समूह की छिपी हुई ज्यामिति को प्रकट कर सकती है, जिससे ध्वनियों के अराजक मिश्रण को मानव गति की एक स्पष्ट तस्वीर में बदला जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।