← नवीनतम पेपर
💻 computer science

HierGait: Hierarchical multi-modal gait recognition method with structural–temporal co-optimization

HierGait एक पदानुक्रमित बहु-मोडल चाल पहचान (gait recognition) ढांचा है जो सूक्ष्म-स्तर की गति कैप्चर, क्रॉस-मोडल संरेखण और टेम्पोरल मॉडलिंग की सीमाओं को दूर करने के लिए एडेप्टिव मल्टी-स्केल टेम्पोरल एन्हांसमेंट, स्ट्रक्चर-गाइडेड अलाइनमेंट फ्यूजन और ग्लोबल कॉन्टेक्स्ट रीकैलिब्रेशन को एकीकृत करता है, जिससे CASIA-B डेटासेट पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Jian Zhang, Ming Xu, Jinglei Zuo, Jun Liu, Yingying Peng

प्रकाशित 2026-08-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jian Zhang, Ming Xu, Jinglei Zuo, Jun Liu, Yingying Peng

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त सड़क पर चलते हुए अपने किसी मित्र को पहचानने की कोशिश कर रहे हैं। आपको उनका चेहरा देखने की ज़रूरत नहीं है; आपको बस यह देखने की ज़रूरत है कि वे कैसे चलते हैं। यही गैत रिकग्निशन (चाल पहचान) का जादू है, जो कंप्यूटर विज़न की एक शाखा है जो लोगों को उनकी अनूठी चलने की शैली द्वारा पहचानती है। यह बिल्कुल वैसा ही है जैसे हमारे शरीर के झूलने, कदम रखने और संतुलन बनाने के तरीके में लिखा गया एक गुप्त कोड। वर्षों से, कंप्यूटर इस कोड को तोड़ने की कोशिश कर रहे हैं, जिसके लिए उन्होंने दो मुख्य "आंखों" का उपयोग किया है: एक जो सिलुएट (silhouette) (एक व्यक्ति की काली, छायादार रूपरेखा) देखती है और दूसरी जो कंकाल (skeleton) (जोड़ों के स्थान का एक स्टिक-फिगर मैप) देखती है। सिलुएट समग्र आकार, जैसे कि कोट या बैकपैक देखने के लिए बेहतरीन है, लेकिन कपड़ों के बदलने पर यह भ्रमित हो जाती है। कंकाल शरीर की संरचना, जैसे कि कूल्हा या घुटना देखने के लिए बेहतरीन है, लेकिन यदि वीडियो धुंधला है या व्यक्ति किसी चीज़ के पीछे छिपा हुआ है, तो यह डगमगा जाता है। वैज्ञानिकों के लिए सबसे बड़ी चुनौती कंप्यूटर को इन दोनों आंखों का एक साथ उपयोग करना सिखाना रही है, बिना उन्हें एक-दूसरे के रास्ते में आए, खासकर जब "स्टिक फिगर" अस्थिर हो या "परछाई" ने कोई भेष बदला हो।

यहाँ HierGait आता है, जो हुनान यूनिवर्सिटी ऑफ ट्रेडिशनल चाइनीज मेडिसिन के शोधकर्ताओं द्वारा प्रस्तावित एक नई विधि है। HierGait को एक सुपर-स्मार्ट जासूस के रूप में समझें जो केवल चलते हुए व्यक्ति को देखता ही नहीं है; बल्कि यह सुनिश्चित करने के लिए कि सही पहचान मिल सके, वह उनसे तीन अलग-अलग स्तरों के विवरण पर पूछताछ करता है। शोधकर्ताओं ने देखा कि पिछली विधियाँ तीन महत्वपूर्ण सुरागों को मिस कर रही थीं: वे सूक्ष्म, तेज़ गतिविधियों पर पर्याप्त बारीकी से ध्यान नहीं दे रही थीं; वे भ्रमित हो रही थीं जब कंकाल का डेटा शोरयुक्त (noisy) था; और वे चलने के वीडियो के हर एक फ्रेम को समान रूप से महत्वपूर्ण मान रही थीं, भले ही कुछ फ्रेम केवल उबाऊ ठहराव हों।

इसे ठीक करने के लिए, HierGait तीन-चरणीय रणनीति का उपयोग करता है। सबसे पहले, यह AMSTB नामक एक मॉड्यूल का उपयोग करता है जो एक हाई-स्पीड कैमरे की तरह शरीर के विभिन्न हिस्सों पर ज़ूम करता है। ठीक वैसे ही जैसे आपके हाथ आपके पैरों की तुलना में अलग गति से झूलते हैं, यह मॉड्यूल अलग-अलग समय के पैमानों (time scales) को देखता है ताकि उन सूक्ष्म, अनूठी सूक्ष्म-गतिविधियों को पकड़ सके जो किसी व्यक्ति के चलने को खास बनाती हैं। दूसरा, यह "शोरयुक्त कंकाल" की समस्या से निपटता है, जिसके लिए MC-SJSF नामक एक मॉड्यूल का उपयोग किया जाता है। कल्पना कीजिए कि आप एक परछाई को स्टिक फिगर से मिलाने की कोशिश कर रहे हैं, लेकिन स्टिक फिगर डगमगा रहा है। यह मॉड्यूल जोड़ों के ऊँचाई पर आधारित एक "संरचनात्मक मानचित्र" (structural map) का उपयोग करता है (जैसे यह जानना कि घुटने हमेशा कंधों से नीचे होते हैं) ताकि कंप्यूटर को मार्गदर्शन मिल सके। यह कंप्यूटर को छाया और कंकाल को सही ढंग से संरेखित करने के लिए मजबूर करता है, भले ही कंकाल का डेटा थोड़ा अस्त-व्यस्त हो। अंत में, GTCFM मॉड्यूल एक फिल्म संपादक की तरह कार्य करता है। पूरी चलने वाली वीडियो को एक साथ देखने के बजाय, यह सबसे रोमांचक "एंकर फ्रेम्स" (anchor frames)—वे क्षण जब बड़े किक या पुश होते हैं—को चुनता है और उबाऊ हिस्सों को अनदेखा कर देता है जहाँ व्यक्ति बस स्थिर खड़ा होता है। फिर यह इन हाइलाइट्स को चलने की स्थिर, समग्र लय के साथ मिला देता है ताकि एक सटीक सारांश बनाया जा सके।

इस दृष्टिकोण के परिणाम काफी प्रभावशाली हैं। CASIA-B डेटासेट पर परीक्षण करते समय, जो चलने की पहचान के लिए एक मानक बेंचमार्क है, HierGait ने सामान्य चलने के लिए 98.8% की रैंक-1 सटीकता, बैग ले जाने पर 96.3%, और भारी कोट पहनने पर 93.2% की सटीकता प्राप्त की। ये संख्याएँ महत्वपूर्ण हैं क्योंकि "कोट" वाला परिदृश्य आमतौर पर कंप्यूटर के लिए संभालना सबसे कठिन होता है, क्योंकि यह व्यक्ति के आकार को पूरी तरह से बदल देता है। शोधकर्ताओं ने CCPG डेटासेट पर भी इस विधि का परीक्षण किया, जो अधिक अराजक, वास्तविक दुनिया की स्थितियों का अनुकरण करता है, जहाँ HierGait ने फिर से अन्य शीर्ष विधियों को पछाड़ते हुए, 75.3% की औसत सटीकता तक पहुँचकर बेहतर प्रदर्शन किया।

यह शोध पत्र सुझाव देता है कि विश्लेषण की इन तीन परतों—स्थानीय विवरण, संरचनात्मक मार्गदर्शन और वैश्विक संपादन—को जोड़कर, सिस्टम कपड़ों में बदलाव और शोरयुक्त डेटा के प्रति बहुत अधिक मजबूत हो जाता है। हालाँकि, लेखक सावधानी बरतते हुए कहते हैं कि सिस्टम अभी भी प्रारंभिक कंकाल डेटा की गुणवत्ता पर निर्भर करता है; यदि कंकाल का पता लगाना पूरी तरह से टूट गया है, तो सिस्टम अपना जादू नहीं चला सकता। हालाँकि यह दुनिया में निगरानी की हर समस्या को हल करने वाला कोई जादुई डंडा नहीं है, लेकिन यह सुझाव देता है कि एक पदानुक्रमित (hierarchical), बहु-चरणीय दृष्टिकोण हमें हमारे चलने के तरीके से पहचानने के लिए कंप्यूटर को सिखाने का एक बहुत ही मजबूत तरीका है, भले ही हम अलग पहनावा पहनकर अपनी पहचान छिपाने की कोशिश करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →