Expert-Guided Multimodal Fusion for Unified Emotion and Sentiment Analysis
यह शोध पत्र EGMF को प्रस्तुत करता है, जो एक एकीकृत ढांचा (unified framework) है जो कई भाषाओं और डेटासेट में डिस्क्रीट इमोशन रिकग्निशन और कंटीन्यूअस सेंटीमेंट एनालिसिस दोनों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक एक्सपर्ट-गाइडेड मल्टी-स्केल नेटवर्क और पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग के साथ लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप केवल उन्हें देखकर अपने एक मित्र के मूड को समझने की कोशिश कर रहे हैं। आप केवल यह नहीं सुनते कि वे क्या कह रहे हैं; बल्कि आप उनके चेहरे के भाव भी देखते हैं, उनकी आवाज़ के लहजे को सुनते हैं, और उनके शारीरिक हाव-भाव (body language) पर भी ध्यान देते हैं। कंप्यूटर विज्ञान की दुनिया में, इसे "मल्टीमॉडल इमोशन अंडरस्टैंडिंग" (multimodal emotion understanding) कहा जाता है। यह आर्टिफिशियल इंटेलिजेंस की एक ऐसी शाखा है जो मशीनों को टेक्स्ट, ऑडियो और वीडियो को मिलाकर वही महसूस करना सिखाने के लिए समर्पित है जो इंसान महसूस करते हैं। लंबे समय तक, कंप्यूटर इसमें बहुत खराब रहे। वे एक वाक्य को पढ़ सकते थे और अनुमान लगा सकते थे कि वह खुश है या दुखी, लेकिन वे अक्सर आवाज़ में छिपे व्यंग्य या मुस्कान के पीछे छिपी उदासी को पकड़ नहीं पाते थे। उन्होंने इन विभिन्न संकेतों को एक एकल, जटिल चित्र के हिस्सों के बजाय अलग-अलग, असंबद्ध पहेली के टुकड़ों की तरह माना। यह महत्वपूर्ण है क्योंकि यदि हम चाहते हैं कि कंप्यूटर मानसिक स्वास्थ्य में मदद करने, हमारे साथ स्वाभाविक रूप से बातचीत करने या सोशल मीडिया का विश्लेषण करने में कुशल हों, तो उन्हें केवल शब्दों को ही नहीं, बल्कि पूर्ण भावनात्मक संदर्भ (emotional context) को समझना होगा।
अब, शोधकर्ताओं की एक नई टीम के बारे में सोचिए जिन्होंने EGMF (एक्सपर्ट-गाइडेड मल्टीमॉडल फ्यूजन) नामक एक सिस्टम बनाया है। इस सिस्टम को एक विशाल भाषाई मस्तिष्क के भीतर काम करने वाली एक सुपर-स्मार्ट जासूसी टोली के रूप में समझें। ऑडियो, वीडियो और टेक्स्ट को बस आपस में जोड़ने के बजाय, उन्होंने एक विशेष "फ्यूजन किचन" बनाया है जहाँ तीन अलग-अलग प्रकार के विशेषज्ञ शेफ मिलकर सटीक भावनात्मक समझ बनाने के लिए काम करते हैं। एक शेफ "लोकल एक्सपर्ट" (Local Expert) है जो हल्की सी शिकन या कांपती हुई आवाज़ जैसे सूक्ष्म विवरणों पर ज़ूम करता है। दूसरा "सिमेंटिक एक्सपर्ट" (Semantic Expert) है जो यह देखता है कि आवाज़ और चेहरा शब्दों के साथ कैसे मेल खाते हैं। तीसरा "ग्लोबल एक्सपर्ट" (Global Expert) है जो पूरी बातचीत के बड़े परिदृश्य को देखने के लिए पीछे हटकर देखता है। ये विशेषज्ञ केवल अपनी राय चिल्लाते नहीं हैं; वे वर्तमान स्थिति के आधार पर यह तय करने के लिए एक स्मार्ट "गेटिंग सिस्टम" (gating system) का उपयोग करते हैं कि किसे बोलना चाहिए। यदि बातचीत अराजक है, तो ग्लोबल एक्सपर्ट नेतृत्व करता है; यदि कोई शांत क्षण है, तो लोकल एक्सपर्ट चमकता है।
शोधकर्ताओं ने पाया कि यह टीम वाला दृष्टिकोण अविश्वसनीय रूप से अच्छा काम करता है। उन्होंने अंग्रेजी और चीनी बातचीत सहित चार अलग-अलग डेटासेट्स पर अपने सिस्टम का परीक्षण किया। अंग्रेजी इमोशन डेटासेट MELD पर, उनके सिस्टम ने 65.57% का वेटेड F1 स्कोर प्राप्त किया, जो पिछले सर्वश्रेष्ठ तरीके से 0.06% अधिक था। चीनी डेटासेट CHERMA पर, उन्होंने 3.36% की भारी बढ़त देखी और 73.90% तक पहुँचे। सेंटीमेंट एनालिसिस (यह मापने के लिए कि कोई चीज़ कितनी सकारात्मक या नकारात्मक है) के लिए, उन्होंने अंग्रेजी MOSEI डेटासेट पर 87.09% और चीनी SIMS-V2 डेटासेट पर 82.43% का स्कोर हासिल किया।
इससे भी अधिक प्रभावशाली यह है कि उन्होंने इसे कैसे किया। पूरे विशाल मस्तिष्क को फिर से प्रशिक्षित करने के बजाय (जिसमें बहुत समय और पैसा खर्च होता), उन्होंने LoRA (लो-रैंक अडैप्टेशन) नामक एक चतुर तकनीक का उपयोग किया। कल्पना कीजिए कि विशाल भाषा मॉडल (language model) किताबों का एक विशाल पुस्तकालय है। हर एक किताब को फिर से लिखने के बजाय, उन्होंने बस नए निर्देशों के साथ कुछ स्टिकी नोट्स जोड़ दिए। इसने उन्हें बिना किसी शहर जितने बड़े सुपरकंप्यूटर की आवश्यकता के, सिस्टम को भावनाओं को समझने के लिए शिक्षित करने की अनुमति दी। उन्होंने यह भी खोजा कि उनका सिस्टम चीनी भाषा को संभालने में विशेष रूप से अच्छा है, जिससे पता चलता है कि "विशेषज्ञ टीम" उस भाषा में दृश्य और श्रव्य संकेतों के जटिल मिश्रण को डिकोड करने में विशेष रूप से सक्षम है। हालाँकि यह सिस्टम पूर्ण नहीं है—यह अभी भी "घृणा" (disgust) जैसे बहुत सूक्ष्म भावों या अत्यधिक तीव्र भावनाओं के साथ थोड़ा संघर्ष करता है—यह साबित करता है कि एक एकीकृत, विशेषज्ञ-निर्देशित दृष्टिकोण मशीनों को मानवीय भावनाओं की अस्त-व्यस्त और सुंदर जटिलता को समझने में मदद करने का एक शक्तिशाली नया तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।