← नवीनतम पेपर
💻 computer science

Pose Grammar Based Deep Neural Network for 3D Human Pose Estimation

यह शोध पत्र HEpose का प्रस्ताव करता है, जो एक हाइब्रिड डीप लर्निंग फ्रेमवर्क है जो 2D जोड़ों की स्थितियों से 3D मानव मुद्राओं को प्रभावी ढंग से अनुमानित करने के लिए समानांतर रैखिक और अवशिष्ट परतों (parallel linear and residual layers) का उपयोग करता है, जिससे बेसलाइन विधियों की तुलना में सटीकता में 50% का सुधार प्राप्त होता है।

मूल लेखक: Zinia Sultana, Md Hasanul Kabir

प्रकाशित 2026-08-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zinia Sultana, Md Hasanul Kabir

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक कंप्यूटर को दुनिया को हमारे समान देखने के लिए सिखाने हेतु, शोधकर्ताओं को पहले एक मौलिक पहेली को हल करना होगा: एक सपाट, द्वि-आयामी (two-dimensional) चित्र को एक जीवंत, त्रि-आयामी (three-dimensional) वास्तविकता में कैसे बदला जाए। जब कोई व्यक्ति कैमरे के सामने खड़ा होता है, तो छवि केवल ऊंचाई और चौड़ाई को ही पकड़ पाती है, जिससे वह गहराई (depth) लुप्त हो जाती है जो यह परिभाषित करती है कि एक शरीर स्थान में कैसे चलता है। यह गायब आयाम मशीनों के लिए मानवीय व्यवहार को समझने के लिए अत्यंत महत्वपूर्ण है, चाहे वह एक रोबोट का मार्गदर्शन करने के लिए हो, किसी पात्र को एनिमेट करने के लिए, या भीड़भाड़ वाली सड़क में सुरक्षा की निगरानी करने के लिए। चुनौती हर जोड़ (joint)—जैसे कोहनी, घुटना, कंधा—की छिपी हुई गहराई का पुनर्निर्माण करने में निहित है, और वह भी केवल एक एकल स्नैपशॉट से। जबकि शुरुआती तरीके इन स्थितियों का अनुमान लगा सकते थे, वे अक्सर मानवीय गतिविधियों की जटिलता, कपड़ों की विविधता और उन वस्तुओं के तरीके से संघर्ष करते थे जिनसे शरीर के कुछ हिस्से छिप जाते हैं। लक्ष्य एक ऐसी प्रणाली बनाना है जो एक सपाट छवि को देख सके और उसके भीतर मौजूद व्यक्ति के पूर्ण, त्रि-आयामी कंकाल (skeleton) का सटीक मानचित्रण कर सके।

हाल ही में किए गए एक अध्ययन में, शोधकर्ताओं ज़िनिया सुल्ताना और एम. हसनुल कबीर ने मानव मुद्रा (human pose) का अनुमान लगाने के लिए विशेष रूप से डिज़ाइन किए गए एक नए प्रकार के आर्टिफिशियल इंटेलिजेंस आर्किटेक्चर को तैयार करके इस समस्या का समाधान किया। उनका कार्य एक विशिष्ट कार्य पर केंद्रित है: एक द्वि-आयामी छवि से 133 विभिन्न शारीरिक जोड़ों के निर्देशांकों (coordinates) को लेना और उनके सटीक त्रि-आयामी स्थानों की भविष्यवाणी करना। ऐसा करने के लिए, उन्होंने पूरी समस्या को एक साथ हल करने के लिए एक एकल, विशाल न्यूरल नेटवर्क को मजबूर करने के बजाय, एक हाइब्रिड सिस्टम बनाया जो तीन अलग-अलग मॉडलों को एक साथ चलाता है, जिससे प्रत्येक मॉडल को मानव रूप के एक अलग पहलू पर ध्यान केंद्रित करने की अनुमति मिलती है और फिर उनके अंतर्दृष्टि को जोड़ा जाता है। उनके सिस्टम का एक भाग डेटा को प्रोसेस करने के लिए सरल, प्रत्यक्ष कनेक्शनों का उपयोग करता है, जबकि दूसरा भाग "रेसिड्यूअल ब्लॉक्स" (residual blocks) के साथ एक अधिक जटिल संरचना का उपयोग करता है—ऐसे स्तर (layers) जो नेटवर्क को भ्रमित हुए बिना अपनी गलतियों से सीखने में मदद करते हैं। तीसरा घटक सबसे नवीन है, क्योंकि इसमें वह शामिल है जिसे लेखक "पोज़ ग्रामर" (pose grammar) कहते हैं। यह अवधारणा मानव शरीर को केवल बिंदुओं के संग्रह के रूप में नहीं, बल्कि एक जुड़े हुए ढांचे के रूप में देखती है जहाँ जोड़ों के बीच विशिष्ट संबंध होते हैं, ठीक वैसे ही जैसे एक वाक्य में व्याकरणिक संरचना होती है जो यह निर्धारित करती है कि शब्द कैसे जुड़ते हैं।

शोधकर्ताओं ने अपने दृष्टिकोण का परीक्षण H3WB नामक एक विशाल डेटासेट का उपयोग करके किया, जिसमें हजारों मानव शरीर के उदाहरण विस्तृत त्रि-आयामी एनोटेशन के साथ शामिल हैं। उन्होंने अपने सिस्टम को इन 6,000 उदाहरणों पर प्रशिक्षित किया और फिर इसे 8,000 अनदेखी छवियों की मुद्राओं की भविष्यवाणी करने की चुनौती दी। परिणामों ने दिखाया कि उनके संयुक्त दृष्टिकोण ने, जिसे उन्होंने HEpose नाम दिया, पिछले तरीकों से काफी बेहतर प्रदर्शन किया। तीन समानांतर मॉडलों को चलाने और उनके आउटपुट को मिलाने से, सिस्टम ने एकल, मानक मॉडल का उपयोग करने की तुलना में जोड़ों की स्थिति की भविष्यवाणी करने में औसत त्रुटि को लगभग आधा कर दिया। सिस्टम शरीर के अंगों के बीच के संबंधों को समझने में विशेष रूप से प्रभावी था; जब शोधकर्ताओं ने उस घटक को हटा दिया जो जोड़ों के कनेक्शन को संभालता था, तो सिस्टम की सटीकता नाटकीय रूप से गिर गई, जिससे यह सिद्ध हुआ कि शरीर कैसे जुड़ा हुआ है, यह समझना व्यक्तिगत जोड़ों को देखने जितना ही महत्वपूर्ण है।

अध्ययन के प्रमुख निष्कर्षों में से एक सिस्टम की जटिलता में सही संतुलन खोजने का महत्व था। शोधकर्ताओं ने नेटवर्क में अधिक परतें जोड़ने का प्रयोग किया, इस उम्मीद में कि एक गहरा सिस्टम बेहतर सीख पाएगा। हालाँकि, उन्होंने पाया कि बहुत अधिक परतें जोड़ने से वास्तव में प्रदर्शन बिगड़ गया, जिससे सिस्टम नई स्थितियों में सामान्य होने के बजाय प्रशिक्षण डेटा को याद करने (memorize) लगा। उन्होंने पाया कि इन जटिल ब्लॉक्स की तीन परतों वाला एक विशिष्ट विन्यास (configuration) सटीक संतुलन बनाता है, जिससे मॉडल मानवीय गति की बारीकियों को सीख पाता है बिना भ्रमित हुए। इसके अलावा, अध्ययन ने "ट्रांसफॉर्मर्स" (transformers) नामक एक लोकप्रिय तकनीक के उपयोग को स्पष्ट रूप से खारिज कर दिया। शोधकर्ताओं ने शुरू में इस आर्किटेक्चर का उपयोग करने का प्रयास किया था, जो भाषा प्रसंस्करण (language processing) में अपनी सफलता के लिए प्रसिद्ध है, लेकिन उन्होंने पाया कि यह उनके डेटासेट के साथ काम करने में विफल रहा क्योंकि डेटा अनुक्रम (sequence) में व्यवस्थित नहीं था। इस विफलता ने उन्हें अपने दृष्टिकोण को परिष्कृत करने के लिए प्रेरित किया, और इसके बजाय समानांतर, बहु-पथ संरचना (multi-path structure) पर ध्यान केंद्रित किया जो अंततः सफल रही।

अंतिम सिस्टम, HEpose ने 150 मिलीमीटर के मार्जिन के भीतर सही जोड़ों की स्थिति की पहचान करने में उच्च सटीकता प्राप्त करके अपनी शक्ति प्रदर्शित की, जो इस क्षेत्र में एक मानक बेंचमार्क है। अन्य अत्याधुनिक (state-of-the-art) तरीकों की तुलना में, नया आर्किटेक्चर लगातार शरीर, चेहरे और हाथों के लिए अधिक सटीक परिणाम देता रहा। शोधकर्ताओं ने उल्लेख किया कि जबकि उनका सिस्टम अत्यधिक प्रभावी है, यह इस धारणा पर निर्भर करता है कि जोड़ों की प्रारंभिक द्वि-आयामी स्थितियाँ पहले से ज्ञात और सटीक हैं। वास्तविक दुनिया के अनुप्रयोगों में, इसका अर्थ है कि इस सिस्टम को एक अलग उपकरण के साथ जोड़ा जाना होगा जो पहले एक सपाट छवि में जोड़ों के स्थान का पता लगा सके। इस निर्भरता के बावजूद, अध्ययन एक स्पष्ट मार्ग प्रदान करता है, यह दिखाते हुए कि विभिन्न प्रकार के न्यूरल नेटवर्क को जोड़ना और मानव शरीर के प्राकृतिक संबंधों का सम्मान करना, मशीनों को मानवीय मुद्रा को उल्लेखनीय सटीकता के साथ देखने और समझने में सक्षम बना सकता है। यह कार्य सुझाव देता है कि कंप्यूटर विज़न का भविष्य बड़े, एकल मॉडल बनाने में नहीं, बल्कि ऐसे बुद्धिमान सिस्टम बनाने में है जो एक साथ कई कोणों से समस्या को देख सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →