← नवीनतम पेपर
💻 computer science

Reconstruction-Gated Refinement for Multimodal Sentiment Analysis under Controlled Perturbations

यह शोधपत्र रिकंस्ट्रक्शन-गेटेड रिफाइनमेंट (RGR) को प्रस्तुत करता है, जो एक प्री-फ्यूजन मॉड्यूल है जो नियंत्रित ऑडियो और विजुअल व्यवधानों के तहत मल्टीमॉडल सेंटीमेंट एनालिसिस मॉडलों की स्थिरता और प्रदर्शन को बढ़ाने के लिए टेक्स्ट-कंडीशनड रिकंस्ट्रक्शन और एडेप्टिव गेटिंग का लाभ उठाता है।

मूल लेखक: Hailong Wang, JinLong Cheng, Zhenxiang Lu

प्रकाशित 2026-09-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hailong Wang, JinLong Cheng, Zhenxiang Lu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डिजिटल युग में, हमारे कंप्यूटरों से न केवल शब्दों से, बल्कि इस बात को समझने की भी बढ़ती मांग की जा रही है कि हम कैसे बोलते हैं और कैसे दिखते हैं। यह क्षेत्र, जिसे मल्टीमॉडल सेंटीमेंट एनालिसिस (multimodal sentiment analysis) कहा जाता है, टेक्स्ट, आवाज और चेहरे के भावों को जोड़कर किसी व्यक्ति के मूड को पढ़ने का प्रयास करता है। यह सार्वजनिक राय की निगरानी करने से लेकर मानसिक स्वास्थ्य का आकलन करने तक, हर चीज़ के लिए एक शक्तिशाली उपकरण है। हालाँकि, एक निरंतर समस्या इन प्रणालियों को परेशान करती है: जबकि हमारे द्वारा टाइप किए गए शब्द आमतौर पर स्पष्ट होते हैं, उनके साथ आने वाले ऑडियो और वीडियो सिग्नल अक्सर अव्यवस्थित होते हैं। बैकग्राउंड शोर आवाज को विकृत कर सकता है, और खराब रोशनी या मुड़ा हुआ सिर चेहरे को अस्पष्ट कर सकता है। जब कंप्यूटर इन अविश्वसनीय संकेतों को टेक्स्ट के साथ मिलाने की कोशिश करता है, तो शोर अंतिम निर्णय को दूषित कर सकता है, जिससे सिस्टम एक खुशी के क्षण को दुख समझ सकता है या इसके विपरीत। मुख्य चुनौती यह पता लगाना है कि टेक्स्ट के साथ मिश्रित होने से पहले इन अस्थिर ऑडियो और वीडियो सुरागों को कैसे साफ किया जाए, बिना उस वास्तविक भावना को फेंके जो उनमें अभी भी हो सकती है।

झोंगयुआन यूनिवर्सिटी ऑफ टेक्नोलॉजी के शोधकर्ताओं ने इस समस्या से निपटने का एक नया तरीका प्रस्तावित किया है, जिसे उन्होंने 'रिकंस्ट्रक्शन-गेटेड रिफाइनमेंट' (Reconstruction-Gated Refinement) नाम दिया है। भ्रम पैदा करने के बाद शोर को ठीक करने की कोशिश करने के बजाय, उनका दृष्टिकोण विभिन्न संकेतों को संयोजित करने से पहले एक फिल्टर के रूप में कार्य करता है। यह प्रणाली एक वाक्य के स्थिर टेक्स्ट का उपयोग एक मार्गदर्शक के रूप में करके यह पुनर्निर्माण करती है कि आवाज और चेहरा वास्तव में कैसा सुनाई और दिखना चाहिए था। कल्पना कीजिए कि एक अनुवादक जो, शोर वाले कमरे में एक अस्पष्ट वाक्यांश सुनने पर, आसपास की बातचीत के संदर्भ का उपयोग करके गायब शब्दों का अनुमान लगाता है; यह प्रणाली ऑडियो और वीडियो के लिए भी ऐसा ही कुछ करती है। यह संकलित, या सारांशित, ऑडियो और विजुअल डेटा को लेती है और टेक्स्ट से उन संकेतों का एक स्वच्छ संस्करण बनाने में मदद मांगती है। यह प्रक्रिया मूल डेटा को पूरी तरह से बदलने के बारे में नहीं है, बल्कि एक ऐसा परिष्कृत संस्करण बनाने के बारे में है जो बोले गए शब्दों के साथ अधिक सुसंगत हो।

यह सुनिश्चित करने के लिए कि सिस्टम सफाई करते समय उपयोगी जानकारी को न छोड़ दे, शोधकर्ताओं ने एक स्मार्ट स्विचिंग तंत्र, या एक 'गेट' जोड़ा है, जो यह तय करता है कि मूल सिग्नल का कितना हिस्सा रखना है बनाम नए पुनर्निर्मित सिग्नल का कितना हिस्सा उपयोग करना है। यदि मूल ऑडियो स्पष्ट है, तो गेट उसका अधिकांश हिस्सा गुजरने देता है। यदि ऑडियो अस्पष्ट है, तो गेट टेक्स्ट-निर्देशित पुनर्निर्माण पर अधिक जोर देता है। यह लचीला मिश्रण कंप्यूटर को कच्चे डेटा को अंधाधुंध अनदेखा किए बिना टेक्स्ट की स्थिरता से लाभ उठाने की अनुमति देता है। टीम ने इस मॉड्यूल को एक मौजूदा, प्रसिद्ध सेंटीमेंट एनालिसिस फ्रेमवर्क में शामिल करके और इसे कई कठोर परीक्षणों के माध्यम से चलाकर इस नई प्रणाली का परीक्षण किया। उन्होंने इसे अंग्रेजी और चीनी दोनों में हजारों वीडियो क्लिप्स वाले तीन प्रमुख डेटासेट्स पर परखा, जिसमें भावनात्मक अभिव्यक्तियों की एक विस्तृत श्रृंखला शामिल थी।

परिणामों ने दिखाया कि यह प्री-फ्यूजन क्लीनिंग प्रक्रिया सिस्टम को अधिक विश्वसनीय बनाती है, विशेष रूप से तब जब डेटा को वास्तविक दुनिया की समस्याओं का अनुकरण करने के लिए जानबूझकर दूषित किया गया हो। उन परीक्षणों में जहाँ ऑडियो और वीडियो में रैंडम शोर जोड़ा गया था, या जहाँ वीडियो के कुछ हिस्सों को पूरी तरह से ब्लॉक कर दिया गया था, नया सिस्टम लगातार मानक संस्करण से बेहतर प्रदर्शन करता रहा। एक बड़े अंग्रेजी डेटासेट पर, परिष्कृत मॉडल ने उच्च सटीकता स्कोर बनाए रखा, भले ही इनपुट अत्यधिक विकृत था, जो अन-रिफाइंड संस्करण की तुलना में दो प्रतिशत अंकों तक का स्पष्ट लाभ दिखाता है। शोधकर्ताओं ने पाया कि यह प्रणाली विशेष रूप से उन स्थितियों में अच्छी थी जहाँ विजुअल या ऑडियो डेटा का आधा या उससे अधिक हिस्सा गायब था, जिससे पता चलता है कि टेक्स्ट-निर्देशित पुनर्निर्माण प्रभावी रूप से अंतराल को भर सकता है। हालाँकि, अध्ययन ने यह भी नोट किया कि ये सुधार नियंत्रित परिस्थितियों में देखे गए जहाँ टेक्स्ट को एक विश्वसनीय मार्गदर्शक माना गया था। उन परिदृश्यों में जहाँ टेक्स्ट स्वयं भ्रामक हो सकता है, जैसे कि व्यंग्य (sarcasm) या विडंबना (irony) में, अन्य संकेतों को परिष्कृत करने की सिस्टम की क्षमता कम प्रभावी हो सकती है।

यह कार्य यह दावा नहीं करता है कि इसने शोर वाले डेटा की समस्या को हमेशा के लिए हल कर दिया है, न ही यह सुझाव देता है कि यह विधि लापता डेटा के लिए डिज़ाइन किए गए अन्य सभी दृष्टिकोणों से बेहतर है, क्योंकि वे विधियाँ अक्सर अलग-अलग परीक्षण नियमों का उपयोग करती हैं। इसके बजाय, अध्ययन इस बात का पुख्ता प्रमाण प्रदान करता है कि ऑडियो और विजुअल रिप्रजेंटेशन को टेक्स्ट के साथ मिलाने से पहले उन्हें परिष्कृत करना एक आशाजनक रणनीति है। शोधकर्ताओं ने प्रदर्शित किया कि टेक्स्ट का उपयोग करके ऑडियो और विजुअल संकेतों का पुनर्निर्माण करने और फिर उन्हें सावधानीपूर्वक मिलाने से, कंप्यूटर वास्तविक दुनिया की रिकॉर्डिंग की अपरिहार्य अव्यवस्था के प्रति अधिक लचीला बन सकता है। हालाँकि वर्तमान प्रयोग विशिष्ट डेटासेट्स और एक एकल प्रकार के अंडरलाइंग आर्किटेक्चर तक सीमित थे, लेकिन निष्कर्ष एक स्पष्ट मार्ग सुझाते हैं: टेक्स्ट को केवल मिश्रित किए जाने वाले एक अन्य इनपुट के रूप में नहीं, बल्कि एक स्थिर एंकर के रूप में देखना जो पूरी भावनात्मक रीडिंग प्रक्रिया को स्थिर करने में मदद कर सकता है। यह दृष्टिकोण सेंटीमेंट एनालिसिस को अधिक मजबूत बनाने का एक व्यावहारिक तरीका प्रदान करता है, यह सुनिश्चित करता है कि मानवीय भावनाओं की समझ स्थिर रहे, भले ही माइक्रोफोन की आवाज फटने लगे या कैमरा हिलने लगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →