← नवीनतम पेपर
💻 computer science

ForensicNet: Lightweight Attention-Enhanced MobileNetV2 for Automated Face Identification

ForensicNet एक हल्का, अटेंशन-एनहांस्ड डीप लर्निंग फ्रेमवर्क है जो पोज़ वेरिएशन और ऑक्लूजन जैसी चुनौतीपूर्ण स्थितियों में उच्च-सटीकता, रियल-टाइम फॉरेंसिक फेस आइडेंटिफिकेशन प्राप्त करने के लिए MobileNetV2 को CBAM और एक टू-फेज़ ट्रांसफर लर्निंग स्ट्रैटेजी के साथ जोड़ता है।

मूल लेखक: Savitha N J, Lata B T

प्रकाशित 2026-07-21
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Savitha N J, Lata B T

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं एक जासूस के रूप में, लेकिन एक आवर्धक लेंस (magnifying glass) के बजाय, आपके पास एक कैमरा है। कंप्यूटर विज्ञान की दुनिया में, एक क्षेत्र है जिसे "फोरेंसिक्स" कहा जाता है जहाँ मशीनें तस्वीरों से लोगों की पहचान करने की कोशिश करती हैं, ठीक वैसे ही जैसे एक इंसान जासूस करता है। लेकिन इसमें एक पेंच है: वास्तविक जीवन के अपराध स्थल फिल्मों की तरह नहीं होते। तस्वीरें अक्सर धुंधली होती हैं, रोशनी बहुत खराब होती है, लोग मास्क पहने होते हैं, या वे दूसरी ओर देख रहे होते हैं। यह कंप्यूटर के लिए यह कहना बेहद कठिन बना देता है कि, "हाँ, यह संदिग्ध है!"

कंप्यूटरों को बेहतर बनाने में मदद करने के लिए, वैज्ञानिक "डीप लर्निंग" का उपयोग करते हैं। इसे एक डिजिटल मस्तिष्क के रूप में सोचें जो परतों से बना है, एक विशाल, बहु-परतीय सैंडविच की तरह। निचली परतें किनारों और वक्रों (curves) जैसी सरल चीजों को सीखती हैं, जबकि ऊपरी परतें जटिल चीजें जैसे कि "यह एक नाक है" या "यह एक मुस्कान है" सीखती हैं। हालांकि, ये डिजिटल मस्तिष्क बहुत भारी और धीमे हो सकते हैं, जैसे एक विशाल ट्रक जो एक संकरी गली से गुजरने की कोशिश कर रहा हो। इसे ठीक करने के लिए, शोधकर्ता "लाइटवेट" (हल्के) मॉडल का उपयोग करते हैं, जो चिकनी, तेज़ स्पोर्ट्स कारों की तरह होते हैं जो बिना गति खोए तंग जगहों से तेज़ी से निकल सकते हैं। वे "अटेंशन" (ध्यान) का भी उपयोग करते हैं, जो कंप्यूटर को चश्मे की एक जोड़ी देने जैसा है जो उसे चेहरे के केवल महत्वपूर्ण हिस्सों (जैसे आंखों) पर ध्यान केंद्रित करने में मदद करता है और बिखरे हुए बैकग्राउंड (जैसे भीड़ या पेड़) को अनदेखा करने में मदद करता है।

यह पेपर एक नया, अत्यंत कुशल डिटेक्टिव टूल पेश करता है जिसे ForensicNet कहा जाता है। शोधकर्ताओं ने एक ऐसा सिस्टम बनाने की कोशिश की जो छोटे उपकरणों (जैसे सुरक्षा कैमरे) पर चलने के लिए पर्याप्त तेज़ हो, लेकिन वास्तविक फोरेंसिक मामलों में पाई जाने जाने वाली कठिन और अस्त-व्यस्त तस्वीरों को संभालने के लिए पर्याप्त स्मार्ट भी हो। उन्होंने एक हल्के इंजन (MobileNetV2) को एक विशेष फोकस तंत्र (CBAM) और एक चतुर प्रशिक्षण पद्धति के साथ जोड़ा। उनका लक्ष्य यह देखना था कि क्या वे एक ऐसा कंप्यूटर बना सकते हैं जो खराब तस्वीरों के बावजूद तेज़ और सटीक दोनों हो।

जासूस का नया चश्मा

इस पेपर के लेखकों, साविता एन. जे. और लता बी. टी. ने एक विशिष्ट समस्या को हल करने के लिए ForensicNet बनाया: मानक कंप्यूटर विजन मॉडल अक्सर तब विफल हो जाते हैं जब तस्वीरें वास्तविक दुनिया (in the wild) में ली जाती हैं। एक आदर्श लैब में, एक कंप्यूटर आसानी से चेहरे को पहचान सकता है, लेकिन एक वास्तविक निगरानी वीडियो में, व्यक्ति भाग रहा हो सकता है, रोशनी कम हो सकती है, या उसका चेहरा आधा ढका हुआ हो सकता है। पेपर सुझाव देता है कि जबकि भारी, शक्तिशाली मॉडल मौजूद हैं, वे सुरक्षा जांच बिंदुओं जैसी जगहों पर रियल-टाइम उपयोग के लिए बहुत धीमे हैं।

इसे ठीक करने के लिए, टीम ने एक "लाइटवेट" सिस्टम बनाया। कल्पना कीजिए कि आप एक भीड़भाड़ वाले, धुंधले कमरे में अपने दोस्त को पहचानने की कोशिश कर रहे हैं। एक भारी कंप्यूटर मॉडल कमरे में मौजूद हर व्यक्ति, फर्नीचर के हर टुकड़े और धुंध के रंग का विश्लेषण करने की कोशिश करेगा, जिसमें बहुत समय लगता है। ForensicNet अलग है। यह एक MobileNetV2 बैकबोन का उपयोग करता है, जो एक सुपर-फास्ट, कुशल स्कैनर की तरह है जो केवल आवश्यक आकृतियों को देखता है। लेकिन इसे और भी बेहतर बनाने के लिए, उन्होंने इसमें CBAM (Convolutional Block Attention Modules) जोड़ा है। आप CBAM को जादुई चश्मे के रूप में देख सकते हैं जो कंप्यूटर को बताते हैं, "बैकग्राउंड के शोर और छाया को अनदेखा करो; पूरी तरह से आंखों और मुंह पर ध्यान केंद्रित करो।" यह कंप्यूटर को विकर्षणों (distractions) को अनदेखा करने और उन विशेषताओं पर ध्यान केंद्रित करने में मदद करता है जो वास्तव में किसी व्यक्ति की पहचान करती हैं।

दो-चरणीय प्रशिक्षण नृत्य (The Two-Step Training Dance)

एक बड़ी चुनौती जिसका यह पेपर समाधान करता है, वह यह है कि वास्तविक दुनिया में कंप्यूटर को सिखाने के लिए "लेबल वाली" तस्वीरों की कमी है। इसे हल करने के लिए, शोधकर्ताओं ने ट्रांसफर लर्निंग का उपयोग किया, लेकिन एक ट्विस्ट के साथ जिसे वे "Adaptive Layer Unfreezing के साथ Two-Phase Transfer Learning Strategy" कहते हैं।

यहाँ बताया गया है कि यह कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए: कल्पना कीजिए कि आप एक ऐसे छात्र को पढ़ा रहे हैं जो पहले से ही पढ़ना जानता है (प्री-ट्रेंड मॉडल) और अब उसे एक विशिष्ट, कठिन बोली (फोरेंसिक डेटा) पढ़ना सिखा रहे हैं।

  1. चरण 1: आप छात्र से कहते हैं, "अभी बुनियादी शब्दों को पढ़ना मत बदलो। बस वाक्य के अंत में नई शब्दावली सीखो।" कंप्यूटर की भाषा में, इसका अर्थ है शुरुआती परतों को फ्रीज (लॉक) रखना ताकि वह सामान्य आकृतियों को याद रखे, जबकि केवल नए "अटेंशन" भागों और अंतिम निर्णय लेने वाले भाग को प्रशिक्षित किया जाए।
  2. चरण 2: एक बार जब छात्र नई शब्दावली समझ लेता है, तो आप कहते हैं, "ठीक है, अब पूरे वाक्य को पढ़ने के तरीके को परिष्कृत (refine) करते हैं।" कंप्यूटर धीरे-धीरे गहरी परतों को "अनफ्रीज" करता है, जिससे इसे फोरेंसिक तस्वीरों के लिए विशिष्ट जटिल विशेषताओं को समझने में मदद मिलती है।

यह विधि मॉडल को बिना भ्रमित हुए या "ओवरफिटिंग" (जो कि अभ्यास टेस्ट को इतनी अच्छी तरह से रटने जैसा है कि आप वास्तविक परीक्षा में विफल हो जाते हैं क्योंकि आप थोड़े अलग प्रश्न को नहीं संभाल पाते) के तेजी से सीखने में मदद करती है।

परिणाम: तेज़ और सटीक

शोधकर्ताओं ने 15,000 चेहरे वाली छवियों के डेटासेट का उपयोग करके ForensicNet का परीक्षण किया, जो 68 अलग-अलग लोगों का प्रतिनिधित्व करती हैं। उन्होंने यह सुनिश्चित करने के लिए कि इसमें विभिन्न पोज़, लाइटिंग और यहाँ तक कि कुछ आंशिक रूप से ढके हुए (occluded) चेहरे भी शामिल हों, वास्तविक फोरेंसिक स्थितियों की नकल की।

जब उन्होंने अपने नए मॉडल की तुलना AlexNet, ResNet-50 और मानक MobileNetV2 जैसे पुराने, भारी मॉडलों से की, तो ForensicNet शीर्ष पर रहा।

  • सटीकता (Accuracy): ForensicNet ने 92.4% सटीकता प्राप्त की। इसका मतलब है कि इसने 100 में से लगभग 93 बार फोटो में व्यक्ति की सही पहचान की।
  • परिशुद्धता (Precision): यह 90.8% सटीक था, जिसका अर्थ है कि जब इसने कहा "यह संदिग्ध है," तो यह आमतौर पर सही था।
  • रिकॉल (Recall): इसका रिकॉल 89.5% था, जिसका अर्थ है कि इसने उन 10 मामलों में से लगभग 9 में संदिग्ध को खोज निकाला जहाँ संदिग्ध वास्तव में मौजूद था।

शायद सबसे महत्वपूर्ण बात यह है कि पेपर इस बात पर जोर देता है कि ForensicNet अविश्वसनीय रूप से कुशल है। इसे प्रति इन्फरेंस (inference) केवल 2.1 GFLOPs (Giga Floating-point Operations) की आवश्यकता होती है। इसे समझने के लिए, पुराने ResNet-50 मॉडल को 3.8 GFLOPs की आवश्यकता थी। इसका मतलब है कि ForensicNet न केवल अधिक सटीक है बल्कि काफी तेज़ और हल्का भी है, जो इसे उन उपकरणों के लिए उपयुक्त बनाता है जिनमें विशाल सुपरकंप्यूटर जुड़े नहीं होते हैं।

मॉडल क्या देखता है

यह साबित करने के लिए कि मॉडल केवल अनुमान नहीं लगा रहा था, लेखकों ने Grad-CAM नामक टूल का उपयोग किया। यह फोटो के ऊपर एक "हीट मैप" बनाता है, जो दिखाता है कि कंप्यूटर छवि के किन हिस्सों को देख रहा था। पेपर दिखाता है कि ForensicNet ने सही ढंग से चेहरे की विशेषताओं (जैसे आंखों और नाक) पर ध्यान केंद्रित किया और बैकग्राउंड को अनदेखा किया, भले ही तस्वीरें धुंधली थीं या रोशनी खराब थी। यह पुष्टि करता है कि "अटेंशन" तंत्र वास्तव में इच्छित रूप से काम कर रहा है।

निष्कर्ष

पेपर निष्कर्ष निकालता है कि ForensicNet फोरेंसिक सेटिंग्स में स्वचालित चेहरे की पहचान के लिए एक सफल कदम है। यह सुझाव देता है कि एक हल्के इंजन को स्मार्ट अटेंशन मैकेनिज्म और एक सावधानीपूर्ण दो-चरणीय प्रशिक्षण प्रक्रिया के साथ जोड़कर, हम ऐसे सिस्टम बना सकते हैं जो वास्तविक दुनिया की निगरानी के लिए तेज़ और सटीक दोनों हैं।

हालाँकि, लेखक अपने काम की सीमाओं को नोट करने में भी सावधान हैं। वे स्वीकार करते हैं कि उनके परीक्षण क्यूरेटेड, सार्वजनिक डेटासेट पर किए गए थे। वे सुझाव देते हैं कि हालांकि परिणाम आशाजनक हैं, मॉडल अभी भी अत्यधिक वास्तविक दुनिया के परिदृश्यों में संघर्ष कर सकता है, जैसे कि गंभीर मोशन ब्लर, अत्यधिक कोण, या बहुत खराब रोशनी जो उनके परीक्षण से परे है। वे प्रस्तावित करते हैं कि भविष्य के कार्य में ट्रांसफॉर्मर्स जैसी नई तकनीकों का उपयोग करना और अधिक बड़े और विविध डेटा सेट पर परीक्षण करना शामिल होगा।

संक्षेप में, ForensicNet एक चतुर, हल्का जासूस है जो शोर को अनदेखा करना और सच्चाई पर ध्यान केंद्रित करना सीखता है, जो फोरेंसिक निगरानी की अव्यवस्थित और अप्रत्याशित दुनिया में चेहरों को पहचानने का एक तेज़ और अधिक कुशल तरीका प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →