A Weighted Sparse Matrix Regression Model for Face Recognition
यह शोध पत्र एक वेटेड स्पार्स मैट्रिक्स रिग्रेशन (WSMR) मॉडल प्रस्तावित करता है जो चेहरे की पहचान में निरंतर अवरोध (occlusion) को प्रभावी ढंग से संभालने के लिए संरचनात्मक और दूरी संबंधी जानकारी को एकीकृत करता है, अनुकूलन के लिए अल्टरनेटिंग डायरेक्शन मेथड ऑफ मल्टीप्लायर्स (ADMM) का उपयोग करता है और सार्वजनिक डेटाबेस पर प्रयोगों के माध्यम से उत्कृष्ट प्रदर्शन प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कंप्यूटर की दुनिया में, किसी मशीन को मानव चेहरे को पहचानना सिखाना एक ऐसा कार्य है जो हमें सरल लगता है लेकिन एक प्रोग्राम के लिए आश्चर्यजनक रूप से कठिन है। एक कंप्यूटर मुस्कुराता हुआ चेहरा या सिकुड़ी हुई भौहें नहीं देखता; वह प्रकाश और अंधेरे के पिक्सेल का प्रतिनिधित्व करने वाला संख्याओं का एक ग्रिड देखता है। जब एक चेहरा स्पष्ट और अच्छी रोशनी में होता है, तो कंप्यूटर इन पैटर्न को ज्ञात चेहरों के डेटाबेस के साथ उच्च सटीकता के साथ मिला सकता है। हालाँकि, वास्तविक दुनिया शायद ही कभी पूर्ण होती है। चेहरे अक्सर धूप के चश्मे, स्कार्फ या किसी पेड़ की छाया से आंशिक रूप से छिपे होते हैं, और रोशनी तेज दोपहर की धूप से लेकर गहरे अंधेरे तक बदल सकती है। ये व्यवधान डेटा में "शोर" (noise) पैदा करते हैं, जिससे कंप्यूटर का मिलान खोजने का प्रयास भ्रमित हो जाता है। वर्षों से, शोधकर्ता ऐसे सिस्टम बनाने की कोशिश कर रहे हैं जो इन विकर्षणों को अनदेखा कर सकें, और यह देखने के लिए एक गणितीय तरीका खोज रहे हैं कि व्यक्ति की वास्तविक पहचान को उस कचरे से कैसे अलग किया जाए जो उन्हें ढंकता है। लक्ष्य एक ऐसा सिस्टम बनाना है जो विश्वसनीय बना रहे, भले ही छवि क्षतिग्रस्त या अधूरी हो, ठीक वैसे ही जैसे एक इंसान एक बरसात के दिन टोपी और धूप का चश्मा पहने अपने दोस्त को पहचान सकता है।
तियानजिन विश्वविद्यालय और दक्षिणी विज्ञान एवं प्रौद्योगिकी विश्वविद्यालय, चीन के शोधकर्ताओं की एक टीम ने इस विशिष्ट समस्या—अस्पष्ट चेहरों—को हल करने के लिए एक नया तरीका प्रस्तावित किया है। वे अपने दृष्टिकोण को 'वेटेड स्पार्स मैट्रिक्स रिग्रेशन मॉडल' (weighted sparse matrix regression model) कहते हैं। यह समझने के लिए कि यह कैसे काम करता है, एक फटी हुई तस्वीर को फिर से बनाने की कोशिश करने की कल्पना करें। यदि आप केवल अन्य सभी तस्वीरों के औसत के आधार पर लुप्त हिस्सों को भरने की कोशिश करते हैं, तो आपको एक धुंधला सा परिणाम मिल सकता है। इसके बजाय, यह नया तरीका क्षति के विशिष्ट पैटर्न को देखता है। शोधकर्ताओं ने महसूस किया कि जब कोई चेहरा किसी वस्तु द्वारा बाधित होता है, तो त्रुटि—वास्तविक चेहरे और कंप्यूटर के अनुमान के बीच का अंतर—एक बड़े, निरंतर ब्लॉक के रूप में बनती है। पुराने तरीकों ने इस त्रुटि को यादृच्छिक, बिखरी हुई गलतियों के संग्रह के रूप में मानने की कोशिश की, जो छोटे धब्बों वाले शोर के लिए तो अच्छा काम करता था लेकिन बड़े क्षेत्रों के छिप जाने पर विफल रहा। नया मॉडल त्रुटि को एक संरचित ब्लॉक के रूप में मानता है, और यह देखता है कि पिक्सेल एक पंक्ति से दूसरी पंक्ति में कैसे बदलते हैं। यह मान लेता है कि यदि एक बड़ा क्षेत्र बाधित है, तो पिक्सेल की पंक्तियों के बीच परिवर्तन बहुत समान होंगे, जिससे एक अनुमानित पैटर्न बनता है जिसे कंप्यूटर अनदेखा करना सीख सकता है।
शोधकर्ताओं ने प्रशिक्षण डेटा के विभिन्न समूहों के महत्व को तौलने (weighing) का एक तरीका भी पेश किया। उनके सिस्टम में, कंप्यूटर प्रत्येक व्यक्ति के कई उदाहरणों से सीखता है। जब यह एक नए, छिपे हुए चेहरे की पहचान करने की कोशिश करता है, तो यह गणना करता है कि वह चेहरे के उन ज्ञात समूहों के कितने करीब है जिनका उसने अध्ययन किया है। यदि ज्ञात चेहरों का एक समूह छिपे हुए चेहरे के बहुत समान है, तो मॉडल उस समूह को उच्च भार (weight) देता है, जिससे उसके सही होने की संभावना बढ़ जाती है। यदि कोई समूह बहुत भिन्न है, तो मॉडल उसे कम भार देता है, जो प्रभावी रूप से कंप्यूटर को उस पर कम ध्यान देने के लिए कहता है। यह वेटिंग सिस्टम कंप्यूटर को उन चेहरों से धोखा खाने से बचने में मदद करता है जो कुछ हद तक समान दिखते हैं लेकिन सही मिलान नहीं होते। इसके अलावा, मॉडल कंप्यूटर को एक सहयोगात्मक दृष्टिकोण अपनाने के लिए प्रोत्साहित करता है, जहाँ वह यह देखता है कि एक ही व्यक्ति के विभिन्न उदाहरण एक पूर्ण चित्र बनाने के लिए मिलकर कैसे काम करते हैं, न कि केवल एक एकल छवि पर निर्भर रहते हैं।
अपने विचार का परीक्षण करने के लिए, शोधकर्ताओं ने चेहरे की छवियों के चार विभिन्न सार्वजनिक डेटाबेस का उपयोग करके अपने मॉडल को कई मौजूदा तरीकों के विरुद्ध चलाया। इन डेटाबेस में अत्यधिक प्रकाश स्थितियों में ली गई तस्वीरें, काले या सफेद ब्लॉकों से ढके चेहरे, और धूप के चश्मे और स्कार्फ जैसे वास्तविक भेष पहने हुए चेहरे शामिल थे। परीक्षणों के एक सेट में, उन्होंने एक्सटेंडेड येल बी (Extended YaleB) डेटाबेस के चित्रों का उपयोग किया, जहाँ चेहरों की फोटोग्राफी बहुत कठोर छाया के तहत की गई थी। जब रोशनी बहुत गंभीर थी, तो पुराने तरीके संघर्ष कर रहे थे, जिनमें से कुछ की पहचान दर 40 प्रतिशत से नीचे गिर गई। हालाँकि, नए मॉडल ने 90 प्रतिशत से अधिक की पहचान दर बनाए रखी, जो अन्य तरीकों से काफी बेहतर प्रदर्शन करती है। एक अन्य प्रयोग में, उन्होंने चेहरे के कुछ हिस्सों को रंग के ठोस ब्लॉकों या यहाँ तक कि अन्य छवियों से ढक दिया, जो भारी अवरोध (occlusion) का अनुकरण करता है। जैसे ही चेहरे के लगभग दो-तिहाई हिस्से को ढकने के लिए अवरुद्ध क्षेत्र का आकार बढ़ा, नया मॉडल लगभग 77 प्रतिशत बार व्यक्ति की सही पहचान करने में सक्षम रहा, जबकि अन्य तरीके बहुत पीछे रह गए।
टीम ने अपने दृष्टिकोण की तुलना आधुनिक डीप लर्निंग सिस्टम से भी की, जो शक्तिशाली कंप्यूटर प्रोग्राम हैं जो डेटा की विशाल मात्रा को प्रोसेस करके सीखते हैं। जबकि ये डीप लर्निंग मॉडल उत्कृष्ट होते हैं जब उन्होंने अपने प्रशिक्षण के दौरान समान उदाहरण देखे होते हैं, वे नए प्रकार के अवरोधों का सामना करने पर संघर्ष करते हैं जिनका उन्होंने पहले अनुभव नहीं किया था। इसके विपरीत, नया रिग्रेशन मॉडल केवल पैटर्न को याद करने के बजाय त्रुटियों की संरचना के बारे में गणितीय नियमों पर निर्भर करता है। इसने इसे नए, जटिल भेषों को अधिक प्रभावी ढंग से संभालने की अनुमति दी, भले ही प्रशिक्षण छवियों की संख्या सीमित हो। शोधकर्ताओं ने पाया कि उनका तरीका विशेष रूप से तब मजबूत था जब अवरोध निरंतर (continuous) था, जैसे कि चेहरे के निचले आधे हिस्से को ढकने वाला एक बड़ा स्कार्फ, एक ऐसी स्थिति जहाँ कई अन्य सिस्टम विफल हो गए।
अध्ययन यह निष्कर्ष निकालता है कि त्रुटि की संरचना पर ध्यान केंद्रित करके और सबसे प्रासंगिक प्रशिक्षण डेटा को प्राथमिकता देने के लिए एक वेटिंग सिस्टम का उपयोग करके, एक ऐसा चेहरा पहचान प्रणाली बनाना संभव है जो वास्तविक दुनिया के हस्तक्षेप के प्रति कहीं अधिक मजबूत हो। शोधकर्ताओं ने प्रदर्शित किया कि उनके मॉडल को एक विशिष्ट गणितीय एल्गोरिदम का उपयोग करके कुशलतापूर्वक हल किया जा सकता है, जिससे यह छवियों को तेजी से प्रोसेस कर सकता है। हालांकि वे स्वीकार करते हैं कि उनका कार्य एक अंतिम समाधान के बजाय एक कदम आगे की ओर है, परिणाम बताते हैं कि यह दृष्टिकोण उन स्थितियों के लिए एक विश्वसनीय विकल्प प्रदान करता है जहाँ चेहरे भारी रूप से बाधित होते हैं या रोशनी खराब होती है। निष्कर्ष बताते हैं कि लुप्त जानकारी की ज्यामिति को समझना उतना ही महत्वपूर्ण है जितना कि शेष जानकारी, जो हमें तब भी पहचानने के लिए भविष्य के सिस्टमों के लिए एक स्पष्ट मार्ग प्रदान करता है जब हम आंशिक रूप से छिपे होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।