← नवीनतम पेपर
💻 computer science

SSRNet: Robust Facial Expression Representation Learning Using Structure Prior and Self-Supervised Regularization

यह शोध पत्र SSRNet का प्रस्ताव करता है, जो एक सुदृढ़ चेहरे के भाव पहचान (facial expression recognition) फ्रेमवर्क है जो शोर और अवरोध (occlusion) जैसी वास्तविक दुनिया की चुनौतियों को प्रभावी ढंग से संबोधित करने के लिए एक संरचना-प्राथमिकता-निर्देशित विशेषता संवर्धन मॉड्यूल (structure-prior-guided feature enhancement module) को स्व-पर्यवेक्षित कंट्रास्टिव लर्निंग (self-supervised contrastive learning) के साथ जोड़ता है, जिससे FER2013 और RAF-DB डेटासेट पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Jing Li, Wenjuan Gu, Junxiang Peng, Xingzheng Xiao, Haijin Xu

प्रकाशित 2026-09-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jing Li, Wenjuan Gu, Junxiang Peng, Xingzheng Xiao, Haijin Xu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कंप्यूटर विज़न के शांत कोनों में, एक विशिष्ट चुनौती लंबे समय से मशीनों को मानवीय भावनाओं को वास्तव में समझने से रोकती रही है: वास्तविक जीवन की अव्यवस्था। जबकि कंप्यूटर एक पूरी तरह से प्रकाशित स्टूडियो फोटो में चेहरे को आसानी से पहचान सकते हैं, वे अक्सर तब लड़खड़ा जाते हैं जब वही चेहरा तिरछा मुड़ा हुआ हो, हाथ से आंशिक रूप से छिपा हो, या कठोर, असमान रोशनी से प्रकाशित हो। इन प्रणालियों को सिखाने के लिए उपयोग किए जाने वाले डेटा से यह कठिनाई और बढ़ जाती है। वे चित्र जिनका उपयोग आर्टिफिशियल इंटेलिजेंस को प्रशिक्षित करने के लिए किया जाता है, अक्सर मनुष्यों द्वारा लेबल किए जाते हैं, और मनुष्य गलतियाँ करते हैं। वे इस बात पर असहमत हो सकते हैं कि एक शिकन गुस्से का संकेत है या घृणा का, या वे किसी फोटो को पूरी तरह से गलत लेबल कर सकते हैं। जब एक कंप्यूटर इन अपूर्ण निर्देशों से सीखता है, तो वह सत्य के बजाय त्रुटियों को याद रखने लगता है, जिससे मॉडल लैब के बाहर नाजुक और अविश्वसनीय हो जाते हैं। चेहरे के भावों को पहचानने का लक्ष्य केवल एक मुस्कान या त्योरियों को पहचानना नहीं है, बल्कि एक ऐसी प्रणाली बनाना है जो मांसपेशियों की गति में उन सूक्ष्म, क्षणिक बदलावों को देख सके जो हमारी भावनाओं को परिभाषित करते हैं, भले ही छवि शोरयुक्त हो और लेबल गलत हों।

इस समस्या से निपटने के लिए, कुनमिंग यूनिवर्सिटी ऑफ साइंस एंड टेक्नोलॉजी की शोधकर्ता जिंग ली और उनकी टीम ने SSRNet नामक एक नया दृष्टिकोण विकसित किया है। मशीन को सब कुछ शून्य से सीखने के लिए मजबूर करने के बजाय, उन्होंने एक ऐसी प्रणाली बनाई जो दो अलग-अलग रणनीतियों को जोड़ती है: एक जो मशीन को चेहरे के सही हिस्सों को देखना सिखाती है, और दूसरी जो उसे उन दृश्य पैटर्नों पर भरोसा करना सिखाती है जिन्हें वह देखती है, भले ही लेबल भ्रमित करने वाले हों। टीम ने एक मानक, विश्वसनीय कंप्यूटर विज़न बैकबोन से शुरुआत की और इसमें मानव शरीर रचना (एनाटॉमी) पर आधारित एक मार्गदर्शन परत जोड़ी। वे जानते थे कि चेहरे के कुछ क्षेत्र—आंखें, भौहें, नाक और मुंह—ही वह स्थान हैं जहाँ भावनाएं सबसे स्पष्ट रूप से अंकित होती हैं। इसलिए, उन्होंने एक मॉड्यूल बनाया जो स्पष्ट रूप से इन क्षेत्रों को उजागर करता है, नेटवर्क को उन विशिष्ट त्वचा के पैच पर अतिरिक्त ध्यान देने के लिए कहता है जहाँ एक शिकन बनती है या एक मुस्कान फैलती है। यह कोई जटिल, बदलता हुआ मानचित्र नहीं है; यह एक स्थिर मार्गदर्शिका है जो यह सुनिश्चित करती है कि सिस्टम कभी भी सबसे अभिव्यंजक विशेषताओं से अपनी दृष्टि न खोए, चाहे चेहरा किसी भी स्थिति में हो या पृष्ठभूमि कितनी भी विचलित करने वाली क्यों न हो।

हालाँकि, सही स्थानों पर ध्यान केंद्रित करना आधी लड़ाई जीतना ही है। शोधकर्ताओं को यह सुनिश्चित करने की भी आवश्यकता थी कि सिस्टम गलत लेबल के कारण होने वाले भ्रम को संभाल सके। इसके लिए, उन्होंने एक स्व-पर्यवेक्षित नियमितीकरण शाखा (self-supervised regularization branch) पेश की। कल्पना कीजिए कि एक छात्र एक परीक्षा के लिए अध्ययन कर रहा है लेकिन उसकी पाठ्यपुस्तक गलतियों (typos) से भरी है। यदि छात्र केवल किताब के पीछे दिए गए उत्तरों को पढ़ता है, तो वह गलतियों को सीख जाएगा। लेकिन यदि छात्र एक ही अवधारणा की विभिन्न तस्वीरों की तुलना करके अभ्यास करता है कि क्या समान रहता है, तो वह गलतियों के बावजूद अंतर्निहित सत्य को सीख सकता है। इसी तरह, इस प्रणाली का यह हिस्सा एक ही चेहरे के विभिन्न संस्करणों को देखता है और यह पहचानने के लिए सीखता है कि वे एक ही व्यक्ति द्वारा व्यक्त की जा रही एक ही भावना हैं, भले ही छवि से जुड़ा लेबल गलत हो। कंप्यूटर को छवियों के भीतर स्वयं निरंतरता खोजने के लिए मजबूर करके, सिस्टम संभावित रूप से त्रुटिपूर्ण मानवीय लेबल पर कम निर्भर और वास्तविक दृश्य साक्ष्य पर अधिक केंद्रित हो जाता है।

इस दोहरे दृष्टिकोण के परिणामों का परीक्षण दो बड़े, वास्तविक दुनिया के डेटासेट पर किया गया जो अपनी जटिलता और शोर के लिए जाने जाते हैं। FER2013 डेटासेट पर, जिसमें अनियंत्रित वातावरण में ली गई हजारों छवियां हैं, नए सिस्टम ने 72.51 प्रतिशत की सटीकता प्राप्त की। RAF-DB डेटासेट पर, जो विविध प्रकाश व्यवस्था और कोणों वाली इंटरनेट-स्रोत छवियों का एक अन्य संग्रह है, इसने 85.09 प्रतिशत तक की उपलब्धि हासिल की। ये संख्याएं कई अन्य अग्रणी तरीकों द्वारा प्राप्त की गई संख्याओं से अधिक थीं, जो यह सुझाव देती हैं कि शारीरिक मार्गदर्शन और स्व-सुधार का संयोजन अच्छी तरह से काम करता है। शोधकर्ताओं ने यह भी परीक्षण किया कि जब उन्होंने प्रशिक्षण डेटा में जानबूझकर अधिक त्रुटियां जोड़ीं, तो सिस्टम कैसा रहा। यहाँ तक कि जब 40 प्रतिशत लेबल गलत थे, तब भी नए सिस्टम ने पुराने मॉडलों पर स्पष्ट बढ़त बनाए रखी, जिससे यह सिद्ध हुआ कि इसने शोर को अनदेखा करना और सिग्नल पर ध्यान केंद्रित करना सीख लिया है।

जब टीम ने यह देखा कि कंप्यूटर दुनिया को कैसे देखता है, तो अंतर स्पष्ट था। पुराने मॉडल विभिन्न भावनाओं को एक अव्यवस्थित बादल की तरह एक साथ रखते थे, डर और आश्चर्य या उदासी और तटस्थता के बीच अंतर करने के लिए संघर्ष करते थे। हालाँकि, नए सिस्टम ने इन भावनाओं को अलग-अलग, घने समूहों (clusters) में व्यवस्थित किया। इसने उन सूक्ष्म विविधताओं को अलग करना सीखा जो एक विशिष्ट भावना को परिभाषित करती हैं, जिससे उनके बीच स्पष्ट सीमाएं बनीं। यह सुझाव देता है कि कंप्यूटर को सही स्थानों पर देखना और अपने स्वयं के अवलोकनों को सत्यापित करना सिखाकर, सिस्टम मानवीय भावना की अधिक स्थिर और सटीक समझ बना सकता है। यह कार्य यह दावा नहीं करता कि इसने हर समस्या को हल कर दिया है; सिस्टम अभी भी चेहरे के पूर्व-निर्धारित मानचित्रों पर निर्भर है, जो गंभीर रूप से बाधित या अत्यधिक कोण पर मुड़े हुए व्यक्ति के मामले में संघर्ष कर सकते हैं। फिर भी, यह मशीनों को हमारे चेहरों को पढ़ने की उसी लचीलापन और सूक्ष्मता के साथ पढ़ने के लिए एक आशाजनक मार्ग प्रदान करता है, जैसा कि हम एक-दूसरे को वास्तविक दुनिया की अपूर्ण रोशनी में पढ़ते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →