← नवीनतम पेपर
💻 computer science

A Robust and Explainable Multimodal Fusion Framework for Emotion Recognition Using Visual–Textual Feature Learning and Ensemble Optimization

यह शोध पत्र एक सुदृढ़ और व्याख्या योग्य मल्टीमॉडल फ्यूजन फ्रेमवर्क प्रस्तावित करता है जो इमोशन रिकग्निशन में स्टेट-ऑफ-द-आर्ट सटीकता (98.41%) प्राप्त करने के लिए विजुअल और टेक्स्टुअल फीचर्स को स्टैक्ड एन्सेम्बल लर्निंग दृष्टिकोण के साथ एकीकृत करता है, जो SHAP और LIME के माध्यम से व्याख्यात्मकता सुनिश्चित करते हुए यूनिमोडल तरीकों से बेहतर प्रदर्शन करता है।

मूल लेखक: Siyu Jia, Xiaoqing Xiaoqing Tang

प्रकाशित 2026-08-20
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Siyu Jia, Xiaoqing Xiaoqing Tang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: भावना पहचान (इमोशन रिकग्निशन) के लिए एक सुदृढ़ और व्याख्या योग्य मल्टीमॉडल फ्यूजन फ्रेमवर्क

समस्या विवरण
वर्तमान भावना पहचान प्रणालियाँ अक्सर यूनिमॉडल डेटा (या तो विजुअल या टेक्स्टुअल) पर निर्भर करती हैं, जो मानवीय भावनाओं की बहुआयामी प्रकृति को कैप्चर करने की उनकी क्षमता को सीमित करती है। यूनिमॉडल दृष्टिकोण अक्सर खराब प्रासंगिक जागरूकता, अस्पष्टता और शोर (नॉइज़) से ग्रस्त होते हैं, जिससे उप-इष्टतम वर्गीकरण प्रदर्शन होता है। इसके अलावा, मौजूदा मल्टीमॉडल मॉडल अक्सर "ब्लैक बॉक्स" के रूप में कार्य करते हैं, जिनमें व्याख्यात्मकता (इंटरप्रिटेबिलिटी) का अभाव होता है, जो स्वास्थ्य सेवा और शिक्षा जैसे संवेदनशील डोमेन में उनके परिनियोजन (डिप्लॉयमेंट) में बाधा डालता है। इसके अतिरिक्त, कई अध्ययन कठोर सुदृढ़ता सत्यापन (रोबस्टनेस वैलिडेशन), जैसे कि क्रॉस-वैलिडेशन, सांख्यिकीय महत्व परीक्षण और एब्लेशन अध्ययन की कमी प्रदर्शित करते हैं, जिससे यह सत्यापित करना कठिन हो जाता है कि प्रदर्शन में सुधार सामान्यीकरण योग्य है या केवल विशिष्ट डेटा स्प्लिट्स का परिणाम है।

कार्यप्रणाली (मेथोडोलॉजी)
लेखक एक व्याख्या योग्य मल्टीमॉडल फ्यूजन फ्रेमवर्क का प्रस्ताव करते हैं जो एनसेम्बल लर्निंग और कठोर सत्यापन तकनीकों का उपयोग करके विजुअल और टेक्स्टुअल फीचर्स को एकीकृत करता है। कार्यप्रणाली एक संरचित पाइपलाइन का अनुसरण करती है:

  1. डेटासेट और प्रीप्रोसेसिंग: अध्ययन में 14 इमोशन क्लासेस के साथ 5,866 संरेखित (अलाइन्ड) नमूनों वाले एक मल्टीमॉडल म्यूजिक इमोशन डेटासेट का उपयोग किया गया है। डुप्लिकेट और लुप्त मानों (मिसिंग वैल्यूज) को संभालने के लिए डेटा का प्रीप्रोसेसिंग किया जाता है, जिसके बाद Z-स्कोर नॉर्मलाइजेशन किया जाता है।
  2. फीचर इंजीनियरिंग:
    • विजुअल और टेक्स्टुअल फीचर्स: फ्रेमवर्क विजुअल और टेक्स्टुअल मोडैलिटीज से प्राप्त कुल 28 इंजीनियर किए गए फीचर्स का उपयोग करता है। विजुअल एट्रीब्यूट्स में सैचुरेशन, टेक्सचर, ब्राइटनेस, ह्यू और मोशन के साथ-साथ इंटरेक्शन टर्म्स शामिल हैं, जबकि अनस्ट्रक्चर्ड टेक्स्ट को स्ट्रक्चर्ड न्यूमेरिकल रिप्रेजेंटेशन में परिवर्तित किया जाता है।
    • फ्यूजन: फ्रेमवर्क अर्ली फीचर-लेवल फ्यूजन का उपयोग करता है, जो विजुअल और टेक्स्टुअल वेक्टर्स को संयोजित (कंकाटेनेट) करके एक एकीकृत प्रतिनिधित्व बनाता है जो क्रॉस-मोडल संबंधों को कैप्चर करता है।
  3. मॉडल आर्किटेक्चर:
    • बेस क्लासिफायर: आठ सुपरवाइज्ड मशीन लर्निंग एल्गोरिदम का बेंचमार्किंग किया गया है: लॉजिस्टिक रिग्रेशन, SVM-RBF, ग्रेडिएंट बूस्टिंग, रैंडम फॉरेस्ट, एक्स्ट्रा ट्रीज़, XGBoost, LightGBM, और CatBoost।
    • एनसेम्बल लर्निंग: एक स्टैक्ड एनसेम्बल दृष्टिकोण लागू किया गया है। हेट्रोजेनियस बेस क्लासिफायर भविष्यवाणियाँ उत्पन्न करते हैं, जिन्हें फिर एक मेटा-क्लासिफायर में फीड किया जाता है ताकि इन भविष्यवाणियों के इष्टतम संयोजन को सीखा जा सके, जिसका लक्ष्य बायस (पक्षपात) और वेरिएंस को कम करना है।
  4. व्याख्यात्मकता (XAI): "ब्लैक बॉक्स" समस्या को संबोधित करने के लिए, फ्रेमवर्क ग्लोबल फीचर इम्पोर्टेंस एनालिसिस के लिए SHAP (SHapley Additive exPlanations) और इंस्टेंस-लेवल इंटरप्रिटेशन के लिए LIME (Local Interpretable Model-agnostic Explanations) को एकीकृत करता है।
  5. सत्यापन और सुदृढ़ता (वैलिडेशन एंड रोबस्टनेस): अध्ययन में स्ट्रैटिफाइड 5-फोल्ड क्रॉस-वैलिडेशन, एब्लेशन एनालिसिस, कॉन्फिडेंस इंटरवल एस्टीमेशन और सांख्यिकीय महत्व परीक्षण (पेयर्ड टी-टेस्ट, फ्रीडमैन टेस्ट, और नेमेनी पोस्ट-हॉक टेस्ट) का उपयोग किया गया है ताकि परिणामों की विश्वसनीयता और सामान्यीकरण सुनिश्चित किया जा सके।

प्रमुख योगदान

  • मल्टीमॉडल इंटीग्रेशन: पेपर एक फ्रेमवर्क प्रस्तुत करता है जो फीचर-लेवल पर पूरक विजुअल और टेक्स्टुअल जानकारी को फ्यूज करता है, यह प्रदर्शित करते हुए कि यह दृष्टिकोण यूनिमॉडल तरीकों की तुलना में समृद्ध भावनात्मक प्रतिनिधित्व प्रदान करता है।
  • व्यवस्थित बेंचमार्किंग: इस विशिष्ट कार्य के लिए आठ विविध मशीन लर्निंग एल्गोरिदम का समान प्रयोगात्मक स्थितियों के तहत व्यापक मूल्यांकन इष्टतम बेस लर्नर्स की पहचान करता है।
    कार्यों के लिए इष्टतम बेस लर्नर्स की पहचान करता है।
  • स्टैक्ड एनसेम्बल ऑप्टिमाइजेशन: अध्ययन प्रदर्शित करता है कि हेट्रोजेनियस बेस क्लासिफायर्स को स्टैक्ड एनसेम्बल के माध्यम से संयोजित करने से व्यक्तिगत मॉडलों की तुलना में प्रेडिक्टिव सटीकता, सुदृढ़ता और सामान्यीकरण में महत्वपूर्ण सुधार होता है।
  • व्याख्यात्मकता कार्यान्वयन: SHAP और LIME का एकीकरण ग्लोबल और लोकल स्पष्टीकरण प्रदान करता है, जो भावना भविष्यवाणियों के प्रमुख चालकों की पहचान करता है और मॉडल पारदर्शिता को बढ़ाता है।
  • कठोर सत्यापन: कई पूर्व अध्ययनों के विपरीत, इस कार्य में व्यापक सुदृढ़ता जाँच शामिल है, जिसमें स्ट्रैटिफाइड क्रॉस-वैलिडेशन, एब्लेशन अध्ययन और सांख्यिकीय महत्व परीक्षण शामिल हैं, ताकि यह सत्यापित किया जा सके कि प्रदर्शन में सुधार यादृच्छिक उतार-चढ़ाव के कारण नहीं है।

परिणाम

  • मल्टीमॉडल श्रेष्ठता: मल्टीमॉडल फ्यूजन ने सभी मूल्यांकन मेट्रिक्स में यूनिमॉडल (केवल विजुअल और केवल टेक्स्ट-ओनली) मॉडल्स को लगातार पछाड़ दिया।
  • क्लासिफायर प्रदर्शन: व्यक्तिगत क्लासिफायर्स में से, एक्स्ट्रा ट्रीज़ (Extra Trees) ने 95.81% की उच्चतम सटीकता प्राप्त की, जिसके बाद रैंडम फॉरेस्ट और LightGBM का स्थान रहा। पारंपरिक लीनियर मॉडल (लॉजिस्टिक रिग्रेशन, SVM-RBF) काफी खराब प्रदर्शन करते हैं।
  • एनसेम्बल प्रदर्शन: प्रस्तावित स्टैक्ड एनसेम्बल ने 98.41% की सटीकता, 98.40% का मैक्रो F1-स्कोर, 0.9829 का MCC, और 0.9986 का ROC-AUC के साथ सर्वश्रेष्ठ समग्र प्रदर्शन प्राप्त किया। यह सर्वश्रेष्ठ व्यक्तिगत क्लासिफायर (एक्स्ट्रा ट्रीज़) की तुलना में लगभग 2.6 प्रतिशत अंक का सुधार है।
  • फीचर इम्पोर्टेंस: SHAP विश्लेषण ने खुलासा किया कि टेक्स्टुअल फीचर्स का भविष्यवाणियों में 52.11% योगदान था, जबकि विजुअल फीचर्स का योगदान 47.89% था। पहचाने गए सबसे प्रभावशाली फीचर्स में सैचुरेशन, टेक्सचर, ब्राइटनेस-कॉन्ट्रास्ट इंटरेक्शन, ह्यू और ब्राइटनेस, के साथ अन्य इंटरेक्शन टर्म्स शामिल थे।
  • सुदृढ़ता: 5-फोल्ड क्रॉस-वैलिडेशन में स्टैक्ड एनसेम्बल ने सबसे कम मानक विचलन (सटीकता के लिए 0.31%) प्रदर्शित किया, जो उच्च स्थिरता का संकेत देता है। सांख्यिकीय परीक्षणों ने पुष्टि की कि मल्टीमॉडल और एनसेम्बल परिणाम यूनिमॉडल और सिंगल-क्लासिफायर बेसलाइन्स की तुलना में काफी बेहतर (p < 0.05) थे।
  • त्रुटि विश्लेषण (एरर एनालिसिस): प्राथमिक भ्रम (confusion) अर्थपूर्ण या दृश्य रूप से समान भावनाओं (जैसे, "सेंटिमेंटल" बनाम "सैड," "मिस्टीरियस" बनाम "डार्क") के बीच हुआ, जो सुझाव देता है कि त्रुटियां अक्सर मॉडल की विफलता के बजाय अंतर्निहित भावनात्मक अस्पष्टता के कारण होती हैं।

महत्व और दावे
पेपर का दावा है कि प्रस्तावित फ्रेमवर्क मल्टीमॉडल इमोशन रिकग्निशन के लिए एक सुदृढ़, सटीक और व्याख्या योग्य समाधान प्रदान करता है। फीचर-लेवल फ्यूजन, स्टैक्ड एनसेम्बल लर्निंग और XAI तकनीकों को जोड़कर, अध्ययन मॉडल पारदर्शिता, सुदृढ़ता सत्यापन और मल्टीमॉडल संदर्भों में एनसेम्बल विधियों के कम उपयोग के संबंध में वर्तमान साहित्य के महत्वपूर्ण अंतराल को संबोधित करता है। लेखक का तर्क है कि उनका दृष्टिकोण उन वास्तविक दुनिया के अनुप्रयोगों में तैनात करने के लिए एक विश्वसनीय आधार प्रदान करता है जहाँ व्याख्यात्मकता और विश्वसनीयता सर्वोतम है। अध्ययन निष्कर्ष निकालता है कि जबकि वर्तमान परिणाम आशाजनक हैं, भविष्य के कार्यों को स्केलेबिलिटी और सामान्यीकरण को और बढ़ाने के लिए ट्रांसफार्मर-आधारित फाउंडेशन मॉडल्स और अतिरिक्त मोडैलिटीज (जैसे ऑडियो और फिजियोलॉजिकल सिग्नल) के एकीकरण की खोज करनी चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →