Human Identification at a Distance: Challenges, Methods and Results on the Competition HID 2025
यह शोध पत्र HID 2025 प्रतियोगिता के परिणामों की रिपोर्ट करता है, जो चुनौतीपूर्ण SUSTech-Competition डेटासेट पर गेट रिकग्निशन (चाल पहचान) प्रदर्शन का मूल्यांकन करता है और यह प्रदर्शित करता है कि हालिया एल्गोरिद्मिक प्रगति ने महत्वपूर्ण पर्यावरणीय विविधताओं के बावजूद 94.2% की एक नई बेंचमार्क सटीकता प्राप्त की है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
"लॉन्ग-डिस्टेंस डिटेक्टिव" चुनौती: कंप्यूटर केवल आपकी चाल से आपको पहचानना कैसे सीखते हैं
कल्पना कीजिए कि आप एक भीड़भाड़ वाले हवाईअड्डा टर्मिनल के सुदूर छोर पर खड़े हैं। आप किसी का चेहरा स्पष्ट रूप से नहीं देख सकते क्योंकि वे बहुत दूर हैं, और निश्चित रूप से आप उनकी उंगलियों के निशान भी नहीं देख सकते। लेकिन, आप गेट की ओर चलते हुए एक व्यक्ति को देखते हैं। बिना उनकी आँखें या नाक देखे भी, आप महसूस करते हैं, "अरे, यह निश्चित रूप से जॉन है! मैं उसकी उस विशिष्ट, थोड़ी उछलती हुई चाल को कहीं भी पहचान लूँगा।"
मानव पहचान (Human Identification at a Distance - HID) बिल्कुल इसी बारे में है। यह पेपर एक विशाल अंतर्राष्ट्रीय "ब्रेन कॉम्पिटिशन" (HID 2025) का वर्णन करता है जहाँ दुनिया के सबसे स्मार्ट कंप्यूटर वैज्ञानिकों ने AI को एक मास्टर डिटेक्टिव बनने के लिए प्रशिक्षित करने की कोशिश की, जो केवल व्यक्ति की चाल (gait)—यानी उनके चलने की अनूठी लय और पैटर्न—को देखकर उन्हें पहचान सके।
चुनौती: "धुंधली छाया" (Blurry Silhouette) का बाधा दौड़
इस प्रतियोगिता को AI के लिए एक उच्च-दांव वाली बाधा दौड़ (obstacle course) की तरह समझें। अधिकांश AI मॉडल उन छात्रों की तरह हैं जिन्होंने केवल उज्ज्वल रोशनी वाले, शांत पुस्तकालयों में पढ़ाई की है। वे नियंत्रित सेटिंग्स में लोगों को पहचानने में माहिर हैं, लेकिन जब चीजें अस्त-व्यस्त हो जाती हैं, तो वे बिखर जाते हैं।
HID 2025 के आयोजकों ने SUSTech-Competition नामक एक डेटासेट का उपयोग करके इस "कोर्स" को अविश्वसनीय रूप से कठिन बना दिया। यह एक जासूस से किसी को पहचानने के लिए कहने जैसा है जबकि:
- "पोशाक परिवर्तन" (The Costume Change): व्यक्ति एक दिन भारी विंटर कोट पहने हुए है और अगले दिन एक लहराता हुआ स्कर्ट।
- "भारी सामान" (The Heavy Luggage): वे एक बड़ा बैकपैक या एक बड़ा सूटकेस ले जा रहे हैं जो उनके शरीर के आकार को बदल देता है।
- "खराब कोण" (The Bad Angle): सुरक्षा कैमरा कोने में ऊपर लगा है, जो एक अजीब कोण से नीचे देख रहा है।
- "रहस्यमयी बॉक्स" (The Mystery Box): वैज्ञानिकों ने टीमों को कोई "चीट शीट" (प्रशिक्षण डेटा) नहीं दी। टीमों को टेस्ट शुरू होने से पहले अपने AI को सिखाने के लिए खुद ही अपने "पाठ्यपुस्तकें" (अन्य डेटासेट) ढूंढनी पड़ीं।
जीतने वाली रणनीतियाँ: कैसे AI "डिटेक्टिव्स" जीते
शीर्ष टीमों ने केवल "स्मार्ट" कंप्यूटर नहीं बनाए; उन्होंने "चतुर" कंप्यूटर बनाए। यहाँ तीन मुख्य तरकीबें दी गई हैं जिनका उन्होंने उपयोग किया, जिन्हें सरल भाषा में समझाया गया है:
1. "डिजिटल दर्जी" (डेटा अलाइनमेंट)
कल्पना कीजिए कि किसी को पहचानना कितना कठिन होगा यदि वे लगातार बाईं ओर, दाईं ओर झुक रहे हों या सुस्त होकर चल रहे हों। जीतने वाली टीमों ने अलाइनमेंट (alignment) नामक तकनीक का उपयोग किया। उन्होंने मूल रूप से व्यक्ति की "छाया" (silhouette) ली और डिजिटल रूप से उन्हें "सीधा खड़ा" कर दिया, जिससे यह सुनिश्चित हुआ कि व्यक्ति सीधा और केंद्र में दिखे। यह एक दर्जी द्वारा सूट को ठीक करने जैसा है ताकि आप शरीर के असली आकार को देख सकें।
2. "अभ्यास ही पूर्ण बनाता है" (फाइन-ट्यूनिंग)
सर्वश्रेष्ठ टीमों ने फाइन-ट्यूनिंग (fine-tuning) नामक रणनीति का उपयोग किया। कल्पना कीजिए कि एक पेशेवर शेफ जो सब कुछ बनाना जानता है (एक "प्री-ट्रेंड मॉडल")। बड़े कुकिंग कॉम्पिटिशन से पहले, वे आयोजन स्थल पर दिए गए स्थानीय मसालों और सामग्रियों के साथ विशेष रूप से अभ्यास करने में कुछ दिन बिताते हैं। इस विशिष्ट चुनौती के लिए थोड़े से वास्तविक डेटा के साथ अभ्यास करके, AI ने इस विशेष लाइटिंग और कैमरा स्टाइल के लिए अपने मस्तिष्क को "ट्यून" किया।
3. "विशेषज्ञों की परिषद" (एन्सेम्बल मेथड्स)
एक एकल "प्रतिभाशाली" AI पर निर्भर रहने के बजाय, कई टीमों ने एक एन्सेम्बल (Ensemble) का उपयोग किया। इसे एक जूरी (jury) की तरह समझें। यह तय करने के लिए कि क्या यह "जॉन" है, एक जज के बजाय, वे पांच अलग-अलग जजों (अलग-अलग AI मॉडल) से पूछते हैं और वोट लेते हैं। यदि पांच में से चार कहते हैं, "यह जॉन है," तो सिस्टम अधिक आश्वस्त होता है और गलती करने की संभावना कम हो जाती है।
परिणाम: एक नया रिकॉर्ड
इस कठिन डेटासेट पर इस प्रतियोगिता से पहले, सटीकता की "सीमा" (ceiling) कम थी। लेकिन 2025 में, शीर्ष टीम ने 94.2% सटीकता का चौंका देने वाला स्तर छुआ।
इसका मतलब है कि कपड़ों की गड़बड़ी, अजीब कोणों और चेहरे के डेटा की अनुपस्थिति के बावजूद, AI किसी व्यक्ति के अनूठे "चलने के हस्ताक्षर" को पहचानने में लगभग एक मानव जासूस जितना कुशल होता जा रहा है।
आगे क्या है? (भविष्य)
पेपर भविष्य की ओर देखते हुए समाप्त होता है। वैज्ञानिक "परछाइयों का पता लगाने" से "दुनिया को समझने" की ओर बढ़ना चाहते हैं। वे निम्नलिखित की ओर देख रहे हैं:
- "सुपर-ब्रेन" का उपयोग: गति को समझने के लिए विशाल AI मॉडल (जैसे ChatGPT के पीछे के मॉडल, लेकिन विजन के लिए) का उपयोग करना।
- बहु-संवेदी पहचान (Multi-Sensory Detection): "छाया" को अन्य सुरागों, जैसे कि व्यक्ति का कंकाल (skeleton) कैसे चलता है, के साथ जोड़ना।
- AI स्वप्न लोक (AI Dream Worlds): मशीनों को सिखाने के लिए "जेनरेटिव AI" (Sora की तरह) का उपयोग करके नकली, सिंथेटिक चलने वाले वीडियो बनाना, जो लोगों की गोपनीयता की रक्षा करता है क्योंकि हमें मशीनों को सिखाने के लिए वास्तविक लोगों के वास्तविक फुटेज की आवश्यकता नहीं होगी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।