From Action Units to Emotions: A Two-Stage Fine-Tuning Framework with Decision-Level Fusion for Facial Expression Recognition
यह शोध पत्र एक दो-चरणीय फाइन-ट्यूनिंग फ्रेमवर्क प्रस्तावित करता है जो एक प्रश्न-उत्तर डेटासेट और एक विशिष्ट छोटे मॉडल के साथ निर्णय-स्तर के संलयन (decision-level fusion) के माध्यम से एक मल्टी-मोडल लार्ज मॉडल की फेशियल एक्शन यूनिट रिकग्निशन और इमोशन क्लासिफिकेशन क्षमताओं को बढ़ाता है, जिससे सूक्ष्म और कम-तीव्रता वाले भावों के लिए फेशियल एक्सप्रेशन रिकग्निशन की सटीकता और व्याख्यात्मकता में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: एक्शन यूनिट्स से भावनाओं तक
समस्या विवरण
चेहरे के भावों की पहचान (Facial Expression Recognition - FER) अभी भी प्रकाश के उतार-चढ़ाव, मुद्रा (pose) के अंतर और एनोटेटेड डेटा की कमी जैसी व्यावहारिक चुनौतियों से बाधित है। मौजूदा डीप लर्निंग मॉडल अक्सर खराब क्रॉस-डोमेन अनुकूलन क्षमता, ओवरफिटिंग और अपर्याप्त व्याख्यात्मकता (interpretability) से जूझते हैं। इसके अलावा, हालांकि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) उन्नत सिमेंटिक समझ प्रदान करते हैं, वे अक्सर सूक्ष्म चेहरे के ज्यामितीय विरूपण (geometric deformations) और माइक्रो-एक्सप्रेशंस को समझने की संवेदनशीलता की कमी रखते हैं। "वीडियो-लेबल" संकेतों पर MLLMs का पारंपरिक एंड-टू-एंड फाइन-ट्यूनिंग अक्सर उन सूक्ष्म मध्यवर्ती निरूपणों (Action Units - AUs) की उपेक्षा करता है जो भावनात्मक अभिव्यक्तियों के आधार होते हैं, जिससे इष्टतम तर्क श्रृंखला (reasoning chains) प्राप्त करने में बाधा आती है।
कार्यप्रणाली
यह शोध पत्र एक डिसीजन-लेवल फ्यूजन के साथ टू-स्टेज फाइन-ट्यूनिंग फ्रेमवर्क का प्रस्ताव करता है, जिसे निम्न-स्तरीय चेहरे के बोध (perception) और उच्च-स्तरीय भावनात्मक अर्थ विज्ञान (semantics) के बीच के अंतर को पाटने के लिए डिज़ाइन किया गया है।
1. टू-स्टेज प्रोग्रेसिव फाइन-ट्यूनिंग
मुख्य रणनीति FER को तीन चरणों वाले पृथक्करण (triple decoupling) को प्राप्त करने के लिए दो क्रमिक शिक्षण चरणों में विभाजित करती है: धारणा से तर्क (perception from reasoning), डोमेन-अज्ञेय ज्ञान से डोमेन-विशिष्ट ज्ञान (domain-agnostic from domain-specific), और भौतिक अवलोकनों से भावना लेबल (physical observations from emotion labels)।
चरण 1: AU-डिटेक्शन फाइन-ट्यूनिंग (बोध/Perception)
- डेटा: इसमें CAS(ME)³ डेटासेट का उपयोग किया जाता है, जो फ्रेम-लेवल एक्शन यूनिट (AU) एनोटेशन प्रदान करता है।
- कार्य: AU पहचान को विजुअल क्वेश्चन अनस्वर्सिंग (VQA) कार्य के रूप में पुनर्गठित किया गया है। मॉडल को विजुअल इनपुट के आधार पर सक्रिय AUs की पहचान करने के लिए निर्देशित किया जाता है, जो फेशियल एक्शन कोडिंग सिस्टम (FACS) के पूर्व ज्ञान का लाभ उठाता है।
- मॉडल: Qwen3-VL-32B-Instruct मल्टीमॉडल लार्ज मॉडल को LoRA (Low-Rank Adaptation) का उपयोग करके फाइन-ट्यून किया गया है, जो केवल मापदंडों के एक छोटे उपसमूह (Query और Value मैट्रिसेस) को अपडेट करता है, जिससे पूर्व-प्रशिक्षित विजुअल-सिमेंटिक ज्ञान सुरक्षित रहता है और AU डिटेक्शन सीखा जा सके।
- उद्देश्य: सूक्ष्म चेहरे के माइक्रो-मूवमेंट्स के लिए मजबूत, डोमेन-अज्ञेय बोध क्षमताओं को स्थापित करना।
चरण 2: एक्सप्रेशन रिकग्निशन फाइन-ट्यूनिंग (तर्क/Reasoning)
- डेटा: यह FER-2013 डेटासेट (स्थिर चित्र जिनमें भावना लेबल हैं लेकिन AU एनोटेशन नहीं हैं) पर स्थानांतरित होता है।
- कार्य: चरण 1 से प्राप्त वेट्स (weights) द्वारा इनिशियलाइज्ड मॉडल को आगे फाइन-ट्यून किया जाता है ताकि डिटेक्ट किए गए AU संयोजनों को भावना श्रेणियों के साथ मैप किया जा सके। आउटपुट फॉर्मेट के लिए आवश्यक है कि मॉडल AUs से अंतिम भावना लेबल तक तर्क करे, जिससे VQA संरचना बनी रहे।
- रणनीति: केवल भावना पहचान के लिए नए LoRA एडैप्टर्स को ऑप्टिमाइज़ किया जाता है; विजुअल एनकोडर और चरण 1 के एडैप्टर्स को फ्रीज रखा जाता है ताकि AU-टू-इमोशन रीजनिंग चेन सुरक्षित रहे।
2. डिसीजन-लेवल फ्यूजन
लार्ज मॉडल्स की सूक्ष्म ज्यामितीय विरूपण को समझने की सीमाओं को दूर करने के लिए, यह फ्रेमवर्क फाइन-ट्यून्ड Qwen3-VL को OpenFace 3.0 के साथ एकीकृत करता है, जो एक विशेष हल्का CNN-आधारित FER मॉडल है।
- तंत्र: यह फ्रेमवर्क दोनों मॉडल्स के प्रोबेबिलिटी डिस्ट्रीब्यूशन ( और ) को एक वेटेड लीनियर इंटरपोलेशन के माध्यम से फ्यूज करता है:
- तर्क: OpenFace 3.0 स्थानीय चेहरे के लैंडमार्क्स और ज्यामितीय विशेषताओं के प्रति संवेदनशीलता प्रदान करता है, जबकि फाइन-ट्यून्ड MLLM उच्च-स्तरीय सिमेंटिक समझ और प्रासंगिक तर्क (contextual reasoning) प्रदान करता है।
मुख्य योगदान
- लार्ज मॉडल बेसलाइन्स का सत्यापन: FER पर Qwen3-VL-32B-Instruct के जीरो-शॉट और फ्यू-शॉट प्रदर्शन का व्यवस्थित मूल्यांकन किया गया, जिससे एक मजबूत बेसलाइन स्थापित हुई।
- AU-गाइडेड टू-स्टेज फाइन-ट्यूनिंग: एक करिकुलम लर्निंग प्रतिमान पेश किया गया जहाँ मॉडल पहले CAS(ME)³ पर AU डिटेक्शन सीखता है और फिर FER-2013 पर भावनाओं को मैप करता है। यह मॉडल को AU इंफरेंस क्षमताओं को प्राप्त करने और एक व्याख्या योग्य श्रृंखला ("पहले AU इंफरेंस, फिर इमोशन प्रेडिक्शन") के माध्यम से तर्क करने में सक्षम बनाता है।
- हेटरोजीनियस मॉडल सहयोग: एक बड़े मल्टीमॉडल मॉडल और एक विशेष छोटे मॉडल (OpenFace 3.0) के बीच डिसीजन-लेवल फ्यूजन की व्यवहार्यता को प्रदर्शित किया गया, जो उनकी पूरक शक्तियों को प्रमाणित करता है।
- मजबूत अनुभवजन्य प्रदर्शन: दिखाया गया कि प्रस्तावित फ्रेमवर्क नॉन-फाइन-ट्यून्ड बेसलाइन्स और स्टैंडअलोन स्पेशलाइज्ड मॉडल्स की तुलना में काफी बेहतर प्रदर्शन करता है, विशेष रूप से अल्पसंख्यक वर्गों (minority classes) के लिए रिकॉल में सुधार करने और व्याख्यात्मकता बढ़ाने में।
प्रयोगात्मक परिणाम
प्रयोग FER-2013 टेस्ट सेट पर आयोजित किए गए, जिसमें एक्यूरेसी (ACC), प्रिसिजन, रिकॉल और F1-स्कोर जैसे मेट्रिक्स शामिल थे।
- बेसलाइन्स के विरुद्ध प्रदर्शन:
- फाइन-ट्यून्ड Qwen3-VL ने 66.73% एक्यूरेसी प्राप्त की, जो नॉन-फाइन-ट्यून्ड बेसलाइन (58.73%) की तुलना में 8 प्रतिशत अंक का सुधार है।
- फ्यूज्ड मॉडल (Qwen3-VL + OpenFace 3.0) ने 67.37% एक्यूरेसी प्राप्त की।
- पारंपरिक CNNs की तुलना में, फ्यूज्ड मॉडल GoogLeNet (67.04%) से थोड़ा बेहतर प्रदर्शन करता है लेकिन ResNet-50 (69.33%), VGG-16 (68.75%), और DenseNet (69.38%) से पीछे रह जाता है।
- कुल एक्यूरेसी में सर्वश्रेष्ठ स्पेशलाइज्ड CNN मॉडल्स को पार न करने के बावजूद, फ्यूज्ड मॉडल ने सुपीरियर वेटेड प्रिसिजन (69.47%) दिखाया, जो ResNet50 (69.84%) के तुलनीय है।
- फ्यूजन के लाभ:
- फ्यूज्ड मॉडल ने शुद्ध लार्ज मॉडल (58.64%) की तुलना में महत्वपूर्ण मैक्रो-रिकॉल (62.71%) सुधार दिखाया, जो अल्पसंख्यक वर्गों (जैसे घृणा, भय) को बेहतर ढंग से पकड़ने का संकेत देता है।
- अकेले OpenFace 3.0 (48.02% एक्यूरेसी) की तुलना में, संयुक्त फ्रेमवर्क ने एक्यूरेसी में 19.35 प्रतिशत अंक का सुधार किया (40.3% सापेक्ष सुधार)।
- व्याख्यात्मकता (Interpretability): मॉडल ने विशिष्ट AU एक्टिवेशन (जैसे AU4, AU7) को भावना निर्णयों से जोड़ते हुए प्राकृतिक भाषा स्पष्टीकरण सफलतापूर्वक उत्पन्न किए, जो "ब्लैक-बॉक्स" CNNs में अनुपस्थित एक ट्रेस करने योग्य तर्क श्रृंखला प्रदान करता है।
महत्व और दावे
शोध पत्र का दावा है कि प्रस्तावित टू-स्टेज फाइन-ट्यूनिंग रणनीति प्रभावी रूप से लार्ज विजुअल मॉडल्स से सूक्ष्म चेहरे के ज्यामितीय विरूपण और कम-तीव्रता वाली अभिव्यक्तियों के लिए डिस्क्रिमिनेटिव फीचर्स को निकालती है, जिन्हें समझने में वे आमतौर पर संघर्ष करते हैं।
लेखक तर्क देते हैं कि जबकि शुद्ध लार्ज विजुअल मॉडल्स के पास जबरदस्त उच्च-स्तरीय सिमेंटिक समझ होती है, उनमें सूक्ष्म चेहरे के विरूपण को समझने में अंतर्निहित सीमाएं हैं। प्रस्तावित विधि इसे निम्नलिखित तरीकों से संबोधित करती है:
- व्याख्यात्मकता को बढ़ाना: AUs को मध्यवर्ती निरूपण के रूप में उपयोग करने से ट्रेस करने योग्य मॉडल आउटपुट मिलता है, जिससे विश्वसनीयता बढ़ती है।
- मजबूती (Robustness) में सुधार: डिसीसन-लेवल फ्यूजन लार्ज मॉडल्स में सूक्ष्म स्थानिक पूर्वजों (spatial priors) की कमी की भरपाई करता है, जिससे अल्पसंख्यक वर्गों पर प्रदर्शन में उल्लेखनीय वृद्धि होती है और प्रमुख वर्गों (head classes) के प्रति पूर्वाग्रह कम होता है।
- एक नया मार्ग प्रदान करना: यह अध्ययन MLLMs और स्पेशलाइज्ड ज्यामितीय मॉडल्स की पूरक शक्तियों का लाभ उठाकर अत्यधिक मजबूत और व्याख्या योग्य FER सिस्टम बनाने के लिए एक तकनीकी प्रतिमान प्रदान करता है, जिसे अनुभवजन्य परिणामों द्वारा सत्यापित किया गया है जो किसी भी एकल मॉडल प्रकार के स्टैंडअलोन इंफरेंस पर पर्याप्त लाभ दिखाते हैं।
लेखक निष्कर्ष निकालते हैं कि हालांकि वर्तमान एक्यूरेसी अभी तक पूर्णतः सर्वश्रेष्ठ स्पेशलाइज्ड CNNs को पार नहीं कर पाई है, फिर भी फ्रेमवर्क भविष्यवाणी विश्वास (prediction confidence), आर्किटेक्चरल व्याख्यात्मकता और अफेक्टिव कंप्यूटिंग में सिनर्जिस्टिक लार्ज-मॉडल अनुप्रयोगों की क्षमता में स्पष्ट श्रेष्ठता प्रदर्शित करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।