← नवीनतम पेपर
💻 computer science

Lightweight Prompt-Based Enhancement for Missing-Modality Multimodal Sentiment Analysis

यह शोध पत्र एक हल्का, प्रॉम्प्ट-आधारित ढांचा प्रस्तावित करता है जिसमें तीन सहक्रियात्मक मॉड्यूल—ऑथेंटिक फीचर एन्हांसमेंट, रिलायबिलिटी-अवेयर फ्यूजन, और कंटेंट-गाइडेड डिस्ट्रीब्यूशन अडैप्टर—शामिल हैं, ताकि सूक्ष्म-स्तरीय विशेषताओं को पुनः प्राप्त करके, फ्यूजन वेट्स को गतिशील रूप से समायोजित करके और वितरण बदलावों को सुधारकर मल्टीमॉडल सेंटीमेंट एनालिसिस में मोडैलिटी मिसिंग की समस्या को प्रभावी ढंग से संबोधित किया जा सके।

मूल लेखक: Juan Liu, Jinping Liu, Hang Zhong, Shikang He

प्रकाशित 2026-09-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Juan Liu, Jinping Liu, Hang Zhong, Shikang He

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मानवीय भावनाएं शायद ही कभी एक एकल स्वर होती हैं; वे शब्दों, आवाज के लहजे और चेहरे की हलचल द्वारा बजाया गया एक जटिल कॉर्ड (chord) हैं। इन भावनाओं को समझने की कोशिश कर रहे कंप्यूटरों को एक साथ तीनों वाद्ययंत्रों को सुनना चाहिए। यह क्षेत्र, जिसे मल्टीमॉडल सेंटीमेंट एनालिसिस (multimodal sentiment analysis) कहा जाता है, ने टेक्स्ट, ऑडियो और वीडियो को जोड़कर मशीनों को हमारे मूड को पढ़ने में सक्षम बनाने में बड़ी प्रगति की है। फिर भी, वास्तविक दुनिया की अव्यवस्थपूर्ण वास्तविकता में, इनमें से एक वाद्ययंत्र अक्सर मौन हो जाता है। एक कैमरा विफल हो सकता है, एक माइक्रोफ़ोन बंद हो सकता है, या गोपनीयता सेटिंग्स वीडियो फीड को ब्लॉक कर सकती हैं। जब एक कंप्यूटर को डेटा के केवल एक अंश के साथ किसी व्यक्ति के मूड का अनुमान लगाने के लिए मजबूर किया जाता है, तो उसकी समझ अक्सर बिखर जाती है, और वह उन सूक्ष्म संकेतों को खो देता है जो वास्तव में यह परिभाषित करते हैं कि हम कैसा महसूस करते हैं।

वर्षों से, शोधकर्ता कंप्यूटर को लापता हिस्से की कल्पना करना सिखाकर इसे ठीक करने की कोशिश कर रहे हैं। वे 'प्रॉम्प्ट लर्निंग' नामक एक तकनीक का उपयोग करते हैं, जहाँ मशीन को उपलब्ध जानकारी के आधार पर लुप्त ऑडियो या वीडियो को पुनर्गठित करने के लिए एक संकेत या "प्रॉम्प्ट" दिया जाता है। हालांकि यह दृष्टिकोण कुशल है, इसमें एक छिपा हुआ दोष है। लापता जानकारी का अनुमान लगाने की प्रक्रिया मानवीय अभिव्यक्ति के तीखे, ऊबड़-खाबड़ किनारों को चिकना करने की प्रवृत्ति रखती है। जिस तरह एक निम्न-गुणवत्ता वाली फोटोकॉपी एक तस्वीर के बारीक कणों को खो देती है, वैसे ही ये पुनर्गठित संकेत उन सूक्ष्म, उच्च-आवृत्ति वाले विवरणों को खो देते हैं—जैसे कि सूक्ष्म-अभिव्यक्ति की त्वरित झपकी या आवाज में अचानक आया कंपन—जो अक्सर भावना की पहचान करने के लिए सबसे महत्वपूर्ण सुराग होते हैं। इसके अलावा, मौजूदा तरीके इन अनुमानित संकेतों के साथ उसी विश्वास के साथ व्यवहार करते हैं जैसा कि वे वास्तविक संकेतों के साथ करते हैं, यह समझने में विफल रहते हैं कि एक पुनर्गठन स्वाभाविक रूप से प्रत्यक्ष रिकॉर्डिंग की तुलना में कम विश्वसनीय होता है। अंततः, क्योंकि ये सिस्टम एक जमे हुए, पूर्व-प्रशिक्षित मस्तिष्क पर निर्भर करते हैं जो नई चीजें तुरंत नहीं सीख सकता, पुनर्गठित डेटा अक्सर शेष सिस्टम के साथ "बेसुरा" महसूस होता है, जिससे मशीन लड़खड़ा जाती है जब वह उन्हें संयोजित करने का प्रयास करती है।

चांगशा सोशल वर्क कॉलेज और हुनान नॉर्मल यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने इन तीन समस्याओं के लिए एक नया, हल्का समाधान प्रस्तावित किया है। उन्होंने पूरी मशीन को फिर से बनाने की कोशिश नहीं की। इसके बजाय, उन्होंने मौजूदा सिस्टम में तीन छोटे, विशिष्ट उपकरण जोड़े, जिन्हें एक कुशल संपादक की तरह काम करने के लिए डिज़ाइन किया गया है जो एक कच्चे मसौदे को परिष्कृत करता है। पहला उपकरण अभी भी उपलब्ध वास्तविक डेटा पर ध्यान केंद्रित करता है। यह प्रामाणिक ऑडियो या वीडियो के चिकने, थोड़े फीके फीचर्स को लेता है और उसमें खोए हुए उच्च-आवृत्ति वाले विवरणों को वापस डाल देता है, प्रभावी रूप से छवि को तेज और ध्वनि को स्पष्ट करता है। दूसरा उपकरण फ्यूजन (विलय) प्रक्रिया के लिए एक द्वारपाल के रूप में कार्य करता है। यह लगातार जांचता रहता है कि कौन से संकेत वास्तविक हैं और कौन से अनुमानित हैं, और स्वचालित रूप से भरोसेमंद डेटा की आवाज़ बढ़ा देता है जबकि पुनर्गठित हिस्सों के शोर को कम कर देता है। तीसरा उपकरण एक अनुवादक है जो यह सुनिश्चित करता है कि अनुमानित डेटा वास्तविक डेटा के साथ फिट बैठे। यह उपलब्ध संकेतों की सामग्री का उपयोग करके पुनर्गठित फीचर्स को सही आकार में धीरे से धकेलता है, ताकि वे कंप्यूटर द्वारा अंतिम निर्णय लेने से पहले शेष जानकारी के साथ सहजता से मिल सकें।

शोधकर्ताओं ने इन तीन-भागों वाले सिस्टम का परीक्षण वीडियो क्लिप्स के एक मानक डेटासेट पर किया जिसमें हजारों मानवीय अंतःक्रियाएं शामिल थीं। उन्होंने एक ऐसी स्थिति का अनुकरण किया जहाँ कंप्यूटर का 70 प्रतिशत डेटा गायब था, जिससे उसे खाली जगहों को भरने के लिए अपनी क्षमता पर बहुत अधिक निर्भर रहने के लिए मजबूर होना पड़ा। परिणामों ने दिखाया कि ये तीन उपकरण मिलकर सबसे अच्छा काम करते हैं, जो एक ऐसे तरीके से कार्य करते हैं जो केवल उनके हिस्सों के योग से कहीं अधिक है। जब तीनों सक्रिय थे, तो सकारात्मक या नकारात्मक भावना को सही ढंग से पहचानने की सिस्टम की क्षमता में उल्लेखनीय सुधार हुआ, जो लगभग 70.6 प्रतिशत की सटीकता तक पहुँच गई, जो कि बेसलाइन से एक बड़ी छलांग है। दिलचस्प बात यह है कि शोधकर्ताओं ने पाया कि केवल पहले दो उपकरणों का उपयोग करने पर वास्तव में अकेले पहले एक के उपयोग की तुलना में प्रदर्शन खराब रहा। इससे पता चला कि वास्तविक और अनुमानित डेटा के बीच बेमेल को ठीक करने के लिए तीसरे उपकरण के बिना, सिस्टम विरोधाभासी संकेतों से भ्रमित हो गया। केवल तभी जब डेटा को सामंजस्यपूर्ण बनाने के लिए डिस्ट्रीब्यूशन एडेप्टर (distribution adapter) जोड़ा गया, तब सिस्टम की पूर्ण क्षमता उजागर हुई।

अध्ययन ने यह भी पता लगाया कि जब डेटा के विशिष्ट प्रकार गायब होते हैं, जैसे कि जब केवल टेक्स्ट उपलब्ध हो या केवल वीडियो गायब हो, तो सिस्टम कैसे व्यवहार करता है। इन निश्चित परिदृश्यों में, पूर्ण सिस्टम फिर से समग्र रूप से सबसे मजबूत साबित हुआ, हालांकि शोधकर्ताओं ने नोट किया कि प्रत्येक उपकरण के विशिष्ट लाभ इस बात पर निर्भर करते थे कि कौन सा डेटा गायब है। उदाहरण के लिए, एक उपकरण वीडियो गायब होने पर मानवीय रेटिंग के साथ सिस्टम की सहसंबंध क्षमता को सुधारने में विशेष रूप से अच्छा था, जबकि पूर्ण संयोजन सामान्य सटीकता में उत्कृष्ट था। इस पूरे संवर्धन ने सिस्टम के आकार में केवल एक बहुत छोटा हिस्सा, मुख्य मॉडल के आकार का लगभग 1 प्रतिशत, नए पैरामीटर जोड़े, जो यह दर्शाता है कि मानवीय भावनाओं को समझने में महत्वपूर्ण सुधार के लिए विशाल, ऊर्जा-खपत करने वाले बड़े बदलावों की आवश्यकता नहीं है।

यह कार्य सुझाव देता है कि मशीनों में अधिक सुदृढ़ भावनात्मक बुद्धिमत्ता का मार्ग लुप्त डेटा की पूर्ण प्रतियां बनाने में नहीं, बल्कि ज्ञात और अनुमानित के बीच के संबंध को सावधानीपूर्वक प्रबंधित करने में निहित है। वास्तविक संकेतों को तेज करके, उन पर अनुमानों की तुलना में अधिक भरोसा करके, और यह सुनिश्चित करके कि अनुमान संदर्भ में फिट बैठें, शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो लुप्त जानकारी को एक नए स्तर की शालीनता के साथ संभालता है। हालांकि अध्ययन अंग्रेजी भाषा के डेटासेट और विशिष्ट लुप्त पैटर्न तक सीमित था, लेकिन निष्कर्ष मशीनों को यह समझने के लिए एक स्पष्ट ब्लूप्रिंट प्रदान करते हैं कि वे हमें तब भी समझ सकें जब कनेक्शन अपूर्ण हो। इस तकनीक का भविष्य ऐसे हल्के, बुद्धिमान समायोजनों पर निर्भर हो सकता है जो कंप्यूटर को हमारी डिजिटल जिंदगी के अंतराल को नेविगेट करने और हमारी मानवता की सूक्ष्मता को खोने से बचने की अनुमति देते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →