← नवीनतम पेपर
💻 computer science

Foundation Model Embeddings Meet Blended Emotions: A Multimodal Fusion Approach for the BLEMORE Challenge

यह शोध पत्र BLEMORE चैलेंज के लिए एक 12-एन्कोडर मल्टीमॉडल फ्यूजन सिस्टम प्रस्तुत करता है जिसने विशेष चेहरे, ऑडियो और बॉडी-लैंग्वेज मॉडलों के साथ Gemini Embedding 2.0 के नवीन अनुप्रयोग को जोड़कर छठा स्थान प्राप्त किया है, जो यह प्रदर्शित करता है कि मिश्रित भावनाओं को पहचानने के लिए फ्रोजन प्रोसोडी लेयर्स (frozen prosody layers) और व्यक्तिगत सैलिएंस थ्रेशोल्ड (personalized salience thresholds) महत्वपूर्ण हैं।

मूल लेखक: Masoumeh Chapariniya, Aref Farhadipour, Sarah Ebling, Volker Dellwo, Teodora Vukovic

प्रकाशित 2026-03-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Masoumeh Chapariniya, Aref Farhadipour, Sarah Ebling, Volker Dellwo, Teodora Vukovic

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक भीड़भाड़ वाली पार्टी में हैं। कोई आपके पास आता है, और वे केवल एक ही भावना महसूस नहीं कर रहे हैं। वे शायद 70% उत्साहित लेकिन 30% घबराए हुए हो सकते हैं। या शायद वे 50% क्रोधित और 50% उदास हैं। भावनाओं के इस मिश्रण को "ब्लेंडेड इमोशन" (मिश्रित भावना) कहा जाता है।

BLEMORE चैलेंज एक उच्च-दांव वाले खेल की तरह है जहाँ कंप्यूटर लोगों के छोटे वीडियो क्लिप देखकर इन मिश्रित भावनाओं का अनुमान लगाने की कोशिश करते हैं। पेचीदा बात यह नहीं है कि केवल यह अनुमान लगाना कि कौन सी भावनाएँ वहाँ हैं, बल्कि यह भी पता लगाना है कि प्रत्येक भावना कितनी प्रबल है (जिसे "सेलिएंस" या प्रमुखता कहते हैं)।

यहाँ बताया गया है कि कैसे ज्यूरिख विश्वविद्यालय की टीम ने एक "सुपर-डिटेक्टिव" (सुपर-जासूस) सिस्टम बनाया ताकि वे इस चुनौती में छठा स्थान प्राप्त कर सकें, इसे सरल शब्दों में समझाया गया है।

1. डिटेक्टिव स्क्वॉड (मल्टीमॉडल एन्सेम्बल)

सिर्फ एक जासूस को काम पर रखने के बजाय, टीम ने छह अलग-अलग विशेषज्ञों की एक टीम (स्क्वाड) बनाई। प्रत्येक विशेषज्ञ वीडियो को एक अलग दृष्टिकोण से देखता है, और फिर वे अंतिम उत्तर देने के लिए एक मेज के चारों ओर बैठते हैं।

  • चेहरे का विशेषज्ञ (S4D-ViTMoE): यह जासूस केवल व्यक्ति के चेहरे को देखता है। उन्हें खुशी या डर दिखाने वाली मांसपेशियों की सूक्ष्म हलचल को पहचानने के लिए प्रशिक्षित किया गया है।
  • बॉडी लैंग्वेज विशेषज्ञ (TimeSformer और VideoMAE): कभी-कभी चेहरा भावहीन (पोकर फेस) होता है, लेकिन शरीर सच बोल देता है। ये विशेषज्ञ व्यक्ति के कंधों, हाथों और मुद्रा (पोस्चर) को देखते हैं। यदि कोई अपनी मुट्ठियाँ भींच रहा है, तो वे जानते हैं कि यह क्रोध है, भले ही चेहरा शांत हो।
  • ध्वनि विशेषज्ञ (Wav2Vec2): यह कान से आवाज सुनता है। लेकिन यहाँ एक ट्रिक है: इस चुनौती में, लोग शब्द नहीं बोल रहे हैं; वे आहें, हँसी या गुर्राने जैसी आवाजें निकाल रहे हैं। टीम ने महसूस किया कि इस AI के "मिडल लेयर्स" (जैसे कि किसी किताब के बीच के अध्याय) लय और पिच को समझने के लिए सबसे अच्छे हैं, जबकि इसके "टॉप लेयर्स" शब्दों को समझने में बहुत व्यस्त होते हैं। इसलिए, उन्होंने शब्द खोजने वालों को नजरअंदाज कर दिया और केवल लय खोजने वालों का उपयोग किया।
  • "सुपर-ब्रेन" (Gemini Embedding 2.0): यह मुख्य आकर्षण है। यह एक विशाल, सामान्य-उद्देश्य वाला AI है (एक सुपर-स्मार्ट रोबोट की तरह जिसने पूरा इंटरनेट देखा है)। टीम ने इस क्षेत्र में पहली बार इसका उपयोग किया। आश्चर्यजनक रूप से, इस रोबोट को भावनाओं का सही अनुमान लगाने के लिए वीडियो के केवल पहले 2 सेकंड देखने की आवश्यकता थी। यह एक ऐसे जासूस की तरह है जो पूरे घर की तलाशी लिए बिना, केवल सामने के दरवाजे को देखकर अपराध को सुलझा सकता है।
  • बैकअप टीम: उन्होंने यह सुनिश्चित करने के लिए कि वे कुछ भी मिस न करें, चुनौती के आयोजकों द्वारा प्रदान किए गए कुछ अन्य पूर्व-प्रशिक्षित टूल्स को भी जोड़ा।

2. वोटिंग सिस्टम (लेट फ्यूजन)

एक बार जब सभी छह विशेषज्ञ अपनी राय दे देते हैं (जैसे, "मुझे लगता है कि यह 60% डर और 40% खुशी है"), तो टीम केवल सबसे तेज़ आवाज़ नहीं चुनती है। वे एक वेटेड वोट (भारित मत) का उपयोग करते हैं।

इसे एक जूरी की तरह समझें। कुछ जूरी सदस्य दूसरों की तुलना में अधिक अनुभवी होते हैं। टीम ने पाया कि "सुपर-ब्रेन" (Gemini) और "चेहरा विशेषज्ञ" सबसे विश्वसनीय थे, इसलिए उन्हें सबसे अधिक वोट मिले। अन्य विशेषज्ञों को कम वोट मिले, लेकिन उनके इनपुट ने गलतियों को सुधारने में मदद की।

3. "थ्रेशोल्ड" की समस्या (डगमगाता हुआ पैमाना)

यह उनकी खोज का सबसे दिलचस्प हिस्सा है। AI के धुंधले अनुमानों (जैसे "70% डर") को अंतिम उत्तर में बदलने के लिए, सिस्टम एक "रूलर" (पैमाने) का उपयोग करता है जिसे थ्रेशोल्ड कहा जाता है।

  • समस्या: टीम ने पाया कि यह पैमाना अस्थिर था। एक अभिनेता के लिए, सूक्ष्म भावना को पकड़ने के लिए पैमाने को बहुत कम रखना पड़ता था। दूसरे अभिनेता के लिए, पैमाने को बहुत ऊंचा रखना पड़ता था।
  • उपमा: कल्पना कीजिए कि आप किसी के फुसफुसाने की आवाज का अनुमान लगाने की कोशिश कर रहे हैं। यदि आप किसी शांत व्यक्ति से बात कर रहे हैं, तो एक फुसफुसाहट भी तेज़ लगती है। यदि आप किसी शोर मचाने वाले व्यक्ति से बात कर रहे हैं, तो वही फुसफुसाहट शांत लगती है। "पैमाना" बोलने वाले के आधार पर बदल जाता है।
  • परिणाम: प्रत्येक अभिनेता की यह "व्यक्तिगत शैली" ही सबसे बड़ा कारण थी जिसकी वजह से कंप्यूटर संघर्ष कर रहा था। यहाँ तक कि सर्वश्रेष्ठ AI भी पूरी तरह से मिश्रण का अनुमान नहीं लगा सका क्योंकि हर इंसान भावनाओं को अलग तरह से व्यक्त करता है।

4. बड़ी जीत

टीम ने तीन प्रमुख सबक सीखे:

  1. पहिए का पुनरुद्धार न करें (Don't reinvent the wheel): ध्वनि वाले हिस्से के लिए, उन्हें AI को सब कुछ शुरू से सिखाने की आवश्यकता नहीं थी। बस एक मौजूदा AI के सही "मिडल लेयर्स" को चुनना नए AI को प्रशिक्षित करने से बेहतर काम कर गया।
  2. बड़े दिमाग तेज़ होते हैं: विशाल "सुपर-ब्रेन" (Gemini) इतना स्मार्ट था कि वह केवल 2 सेकंड के क्लिप से भावनाओं का सही अनुमान लगा सकता था, जिससे साबित हुआ कि विशाल AI मॉडल इस तरह के काम के लिए तैयार हैं।
  3. इंसान अद्वितीय हैं: चुनौती का सबसे कठिन हिस्सा कंप्यूटर की बुद्धिमत्ता नहीं थी; बल्कि यह था कि सभी मनुष्य अलग-अलग होते हैं। एक कंप्यूटर नियम सीख सकता है, लेकिन वह आसानी से यह अनुमान नहीं लगा सकता कि आप विशेष रूप से अपनी भावनाओं को कैसे व्यक्त करेंगे।

अंतिम स्कोर

इन सभी विशेषज्ञों को मिलाने और मिलकर वोट देने से, टीम ने 0.279 का स्कोर प्राप्त किया, जो पिछले सर्वश्रेष्ठ प्रयासों से बेहतर था। उन्होंने साबित कर दिया कि यदि आप मिश्रित भावनाओं को समझना चाहते हैं, तो आपको चेहरे, शरीर, ध्वनि को देखना होगा और इन सबको जोड़ने के लिए एक सुपर-स्मार्ट AI का उपयोग करना होगा।

संक्षेप में: उन्होंने विशेषज्ञों की एक ऐसी टीम बनाई जिन्होंने मिश्रित भावनाओं की जटिल, अव्यवस्थित और बहुत मानवीय दुनिया को पढ़ने के लिए अपने अद्वितीय कौशल को मिलाया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →