← नवीनतम पेपर
⚡ electrical engineering

A Mixture-of-Experts Model for Multimodal Emotion Recognition in Conversations

यह शोध पत्र MiSTER-E का प्रस्ताव करता है, जो एक मॉड्यूलर मिक्सचर-ऑफ-एक्सपर्ट्स फ्रेमवर्क है जो फाइन-ट्यून्ड स्पीच और टेक्स्ट एलएलएम (LLMs) का उपयोग करके मोडैलिटी-विशिष्ट संदर्भ मॉडलिंग को मल्टीमॉडल फ्यूजन से अलग करता है, और स्पीकर आइडेंटिटी पर निर्भर हुए बिना तीन बेंचमार्क इमोशन रिकग्निशन डेटासेट्स पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करता है।

मूल लेखक: Soumya Dutta, Smruthi Balaji, Sriram Ganapathy

प्रकाशित 2026-02-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Soumya Dutta, Smruthi Balaji, Sriram Ganapathy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दोस्तों के एक समूह के बीच चल रही एक गरमागरम, भावनात्मक बातचीत के मूड को समझने की कोशिश कर रहे हैं। आपके पास जानकारी जुटाने के दो मुख्य तरीके हैं: वे क्या कह रहे हैं (टेक्स्ट/शब्द) और वे कैसे कह रहे हैं (उनकी आवाज़ का लहजा)।

कभी-कभी शब्द व्यंग्यात्मक होते हैं, लेकिन लहजा गुस्से वाला होता है। अन्य बार, शब्द खुशी वाले होते हैं, लेकिन आवाज़ उदास सुनाई देती है। भावना का अनुमान लगाने की कोशिश करने वाले कंप्यूटर को इन दोनों सुरागों को एक साथ संभालना पड़ता है, जबकि उसे यह भी याद रखना होता है कि बातचीत में पाँच मिनट पहले क्या कहा गया था।

यह पेपर एक नए AI सिस्टम जिसे MiSTER-E (Mixture of Speech-Text Experts for Recognition of Emotions) कहा जाता है, का परिचय देता है जो इस समस्या को हल करता है। यह एक अकेले, अत्यधिक काम करने वाले जासूस के बजाय एक अत्यधिक संगठित प्रबंधन टीम की तरह काम करता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "स्विस आर्मी नाइफ" बनाम विशेषज्ञ टीम

भावना पहचान के अधिकांश पुराने AI मॉडल एक स्विस आर्मी नाइफ की तरह हैं। वे सब कुछ एक ही ब्लेड से करने की कोशिश करते हैं: वे शब्दों को देखते हैं, आवाज़ सुनते हैं, अतीत को याद रखते हैं और एक ही समय में भावना का अनुमान लगाते हैं। समस्या यह है कि जब डेटा अव्यवस्थित या कम होता है, तो यह "एक ही आकार में फिट होने वाला" दृष्टिकोण भ्रमित हो जाता है। यह एक साथ बहुत सारी चीजें सीखने की कोशिश करता है और अक्सर गलत पैटर्न सीख लेता है।

MiSTER-E रणनीति बदल देता है। एक चाकू के बजाय, यह तीन विशेषज्ञ टीमों को काम पर रखता है:

  • आवाज़ विशेषज्ञ (The Voice Expert): केवल आवाज़ के लहजे को सुनता है। यह शब्दों को पूरी तरह से अनदेखा कर देता है।
  • टेक्स्ट विशेषज्ञ (The Text Expert): केवल शब्दों को पढ़ता है। यह लहजे को पूरी तरह से अनदेखा कर देता है।
  • फ्यूजन विशेषज्ञ (The Fusion Expert): दोनों को सुनता है और यह देखने की कोशिश करता है कि वे एक साथ कैसे काम करते हैं।

2. "मैनेजर" (गेटिंग मैकेनिज्म)

तीन विशेषज्ञों का होना अच्छा है, लेकिन यह कौन तय करता है कि किसकी बात सुननी है? यहाँ आता है मैनेजर (जिसे गेटिंग मैकेनिज्म कहा जाता है)।

एक ऐसी बातचीत की कल्पना करें जहाँ कोई कहता है, "यह तो बहुत अच्छा है," लेकिन वह इसे गुस्से में चिल्लाकर कह रहा है।

  • टेक्स्ट विशेषज्ञ "अच्छा" शब्द को देखता है और सोचता है: "यह खुशी वाला है!"
  • आवाज़ विशेषज्ञ चिल्लाहट सुनता है और सोचता है: "यह गुस्से वाला है!"
  • फ्यूजन विशेषज्ञ इस टकराव को देखता है और समझने की कोशिश करता है कि यह क्या है।

मैनेजर स्थिति को देखता है। वह महसूस करता है कि आवाज़ चिल्ला रही है, इसलिए वह कहता है, "ठीक है, मैं आवाज़ विशेषज्ञ पर 80% और फ्यूजन विशेषज्ञ पर 20% भरोसा करूँगा, और इस विशिष्ट क्षण के लिए टेक्स्ट विशेषज्ञ को अनदेखा कर दूँगा।"

यही Mixture-of-Experts (MoE) का जादू है। सिस्टम केवल उत्तरों का औसत नहीं निकालता; यह गतिशील रूप से तय करता है कि वाक्य-दर-वाक्य, कौन सा विशेषज्ञ सबसे विश्वसनीय है। यदि माइक्रोफ़ोन खराब है और आवाज़ शोर भरी है, तो मैनेजर स्वचालित रूप से टेक्स्ट विशेषज्ञ पर अधिक भरोसा करेगा। यदि टेक्स्ट अस्पष्ट है, तो वह आवाज़ विशेषज्ञ पर अधिक भरोसा करेगा।

3. "संदर्भ" (कहानी को याद रखना)

भावनाएँ शून्य में पैदा नहीं होतीं। यदि कोई बहस के बाद "मैं ठीक हूँ" कहता है, तो इसका अर्थ एक प्रशंसा के बाद कहे गए "मैं ठीक हूँ" से अलग होता है।

MiSTER-E अपने विशेषज्ञों को एक मेमोरी बैंक देता है। अनुमान लगाने से पहले, वे बातचीत को "कॉन्टेक्स्ट एडिशन नेटवर्क" के माध्यम से चलाते हैं। इसे एक रिहर्सल रूम की तरह समझें जहाँ विशेषज्ञ कहानी के प्रवाह को समझने के लिए पिछले संवादों की समीक्षा करते हैं। यह सुनिश्चित करता है कि वे संदर्भ के बिना किसी एक वाक्य से धोखा न खा जाएँ।

4. "ट्रेनिंग कैंप" (वे सहमत होना कैसे सीखते हैं)

यह सुनिश्चित करने के लिए कि ये विशेषज्ञ मनमानी न करें और बिल्कुल अलग जवाब न दें, सिस्टम एक विशेष प्रशिक्षण तकनीक का उपयोग करता है जिसे कॉन्ट्रास्टिव लॉस (Contrastive Loss) कहा जाता है।

कल्पना कीजिए कि तीन विशेषज्ञ एक कक्षा में छात्र हैं। शिक्षक (AI ट्रेनर) उन्हें एक उदास चेहरे की तस्वीर दिखाता है।

  • आवाज़ वाला छात्र एक उदास चेहरा बनाता है।
  • टेक्स्ट वाला छात्र एक उदास चेहरा बनाता है।
  • फ्यूजन वाला छात्र एक उदास चेहरा बनाता है।

शिक्षक एक विशेष नियम का उपयोग करता है: "यदि आप सभी एक ही चीज़ बनाते हैं, तो आपको बोनस मिलता है। यदि आप अलग-अलग चीज़ें बनाते हैं, तो आपको और कड़ी मेहनत करनी होगी।" यह विशेषज्ञों को भावनाओं की अपनी समझ को संरेखित करने के लिए मजबूर करता है, भले ही वे अलग-अलग संकेतों को देख रहे हों।

5. परिणाम: यह बेहतर क्यों है?

लेखकों ने MiSTER-E का परीक्षण तीन प्रसिद्ध डेटासेट्स (फिल्मों और टीवी शो से रिकॉर्ड की गई बातचीत के संग्रह) पर किया।

  • IEMOCAP: 70.9% सटीकता।
  • MELD: 69.5% सटीकता।
  • CMU-MOSI: 87.9% सटीकता।

इसने पहले से टेस्ट किए गए लगभग हर अन्य सिस्टम को पछाड़ दिया। महत्वपूर्ण बात यह है कि इसने यह बिना यह जाने किया कि बोलने वाले कौन थे। इसने "जॉन हमेशा गुस्से में रहता है" को याद करके धोखाधड़ी नहीं की। इसने भावना को ही समझना सीखा, जिससे यह अधिक स्मार्ट और सामान्य बनाने योग्य बन गया।

बड़ी तस्वीर का रूपक (The Big Picture Analogy)

पारंपरिक AI को एक सोलो म्यूजिशियन के रूप में सोचें जो अकेले एक जटिल सिम्फनी बजाने की कोशिश कर रहा है। वे एक नोट चूक सकते हैं या अभिभूत हो सकते हैं।

MiSTER-E एक कंडक्टर के साथ एक जैज़ ट्रियो (Jazz Trio) है।

  • पियानो (टेक्स्ट विशेषज्ञ) धुन जानता है।
  • ड्रम्स (आवाज़ विशेषज्ञ) लय और तीव्रता जानते हैं।
  • बास (फ्यूजन विशेषज्ञ) जानता है कि वे एक साथ कैसे फिट होते हैं।
  • कंडक्टर (मैनेजर) कमरे को सुनता है और तय करता है, "अभी, ड्रम्स को नेतृत्व करने दें क्योंकि लय भावना को चला रही है।"

सही समय पर सही विशेषज्ञ को चमकने देने से, MiSTER-E मानव भावनाओं को पहले से कहीं अधिक स्वाभाविक और सटीक रूप से समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →