← नवीनतम पेपर
💻 computer science

A Dual-Balance Framework for Long-Tailed Multimodal Relation Extraction

यह शोधपत्र एक एकीकृत डुअल-बैलेंस फ्रेमवर्क प्रस्तावित करता है जो क्रॉस-मोडल निरंतरता के लिए मोडैलिटी-ब्रांच फ्यूजन रणनीति और बेहतर टेल रिलेशन रिकग्निशन के लिए प्रायर-अवेयर क्लास कैलिब्रेटर के माध्यम से लॉन्ग-टेल्ड मल्टीमॉडल रिलेशन एक्सट्रैक्शन में लेबल और मोडैलिटी दोनों असंतुलनों को संबोधित करता है, जो MNRE और MORE बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Zhihao Lin, Hailin Wang, Ao Ma, Hangyi Ren, He Ma, Yanbing Xie, Dan Zhang

प्रकाशित 2026-08-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhihao Lin, Hailin Wang, Ao Ma, Hangyi Ren, He Ma, Yanbing Xie, Dan Zhang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

सोशल मीडिया के विशाल और शोर-शराबे वाले परिदृश्य में, जहाँ प्रतिदिन अरबों पोस्ट शब्दों को चित्रों के साथ मिलाते हैं, कंप्यूटरों के सामने एक कठिन कार्य होता है: इस संयोजन के पीछे के वास्तविक अर्थ को समझना। मल्टीमॉडल रिलेशन एक्सट्रैक्शन (multimodal relation extraction) के रूप में ज्ञात यह क्षेत्र, मशीनों से यह पहचानने के लिए कहता है कि एक ही पोस्ट के भीतर दो व्यक्ति, स्थान या वस्तुएं एक-दूसरे से कैसे जुड़ी हुई हैं। यह मानव ज्ञान के डिजिटल मानचित्र बनाने के लिए एक मौलिक कौशल है, जिससे सर्च इंजन विशिष्ट तथ्यों को खोज पाते हैं और आर्टिफिशियल इंटेलिजेंस को हमारी दुनिया को समझने में मदद मिलती है। हालाँकि, एक कंप्यूटर के सीखने के लिए, इसे उदाहरणों की विशाल मात्रा पर प्रशिक्षित किया जाना चाहिए। समस्या यह है कि वास्तविक दुनिया का डेटा शायद ही कभी निष्पक्ष होता है। जिस प्रकार एक पुस्तकालय में किसी बेस्टसेलर की हजारों प्रतियां हो सकती हैं लेकिन एक दुर्लभ, अस्पष्ट पुस्तक की केवल एक प्रति हो सकती है, सोशल मीडिया डेटा सामान्य संबंधों से भरा होता है जबकि दुर्लभ, विशिष्ट संबंध बहुत कम उदाहरणों के साथ छोड़ दिए जाते हैं। इसके अलावा, सूचना के दो प्रकार—टेक्स्ट और चित्र—हमेशा एकमत नहीं होते हैं। एक चित्र धुंधला, भ्रामक या केवल अप्रासंगिक हो सकता है, जबकि टेक्स्ट स्पष्ट हो सकता है, या इसके विपरीत। जब एक कंप्यूटर इस असमान और शोर भरे मिश्रण से सीखने की कोशिश करता है, तो वह दुर्लभ संबंधों और भ्रमित करने वाली छवियों को अनदेखा करने लगता है, जिससे वह पूरी कहानी को समझने में विफल रहता है।

साउथवेस्टर्न यूनिवर्सिटी ऑफ फाइनेंस एंड इकोनॉमिक्स के शोधकर्ताओं ने इन विशिष्ट समस्याओं को हल करने के लिए डिज़ाइन किया गया एक नया सिस्टम विकसित किया है। उन्होंने पहचाना कि मानक कंप्यूटर मॉडल अक्सर इसलिए फंस जाते हैं क्योंकि वे सबसे आम प्रकार के संबंधों से अभिभूत हो जाते हैं और अविश्वसनीय चित्रों से भ्रमित हो जाते हैं। इसे हल करने के लिए, उन्होंने एक एकीकृत ढांचा बनाया जो एक 'डुअल-बैलेंस' (दोहरा-संतुलन) प्रणाली के रूप में कार्य करता है, जो दुर्लभ डेटा और संघर्षपूर्ण जानकारी की समस्या को एक साथ संबोधित करता है। टेक्स्ट और छवियों को शुरुआत से ही समान भागीदार मानने के बजाय, उनका सिस्टम उन्हें सावधानीपूर्वक वजन देने (weigh) के लिए सीखता है। यह समझता है कि कभी-कभी एक चित्र शोर भरा होता है और उस पर कम भरोसा किया जाना चाहिए, जबकि टेक्स्ट सत्य रखता है, और अन्य समय में, चित्र एक महत्वपूर्ण सुराग प्रदान करता है जिसे शब्दों ने छोड़ दिया था। यह अनुकूलन योग्य दृष्टिकोण कंप्यूटर को सबसे अधिक बार दिखने वाले पैटर्न का आँख मूंदकर अनुसरण करने के बजाय, प्रत्येक विशिष्ट पोस्ट के लिए सही संकेत पर ध्यान केंद्रित करने की अनुमति देता है।

उनका समाधान दूसरा हिस्सा "लॉन्ग टेल" (long tail) की समस्या से निपटता है, जहाँ दुर्लभ संबंधों को इसलिए अनदेखा कर दिया जाता है क्योंकि वे प्रशिक्षण डेटा में बहुत कम बार दिखाई देते हैं। मानक मॉडल स्वाभाविक रूप से सामान्य संबंधों की ओर पक्षपाती हो जाते हैं, ठीक वैसे ही जैसे कोई व्यक्ति जो केवल सुर्खियों को पढ़ता है और गहरी कहानियों को मिस कर देता है। शोधकर्ताओं ने एक ऐसी प्रक्रिया पेश की जो कंप्यूटर की अंतिम निर्णय लेने की प्रक्रिया को समायोजित करती है। प्रशिक्षण सेट में प्रत्येक प्रकार के संबंध के कितनी बार दिखाई देने के तरीके को देखकर, सिस्टम अपने स्वयं के पूर्वाग्रह को सचेत रूप से ठीक कर सकता है। यह अनिवार्य रूप से मॉडल को बताता है, "सामान्य उत्तरों में इतने आश्वस्त न हों; दुर्लभ वाले पर अधिक ध्यान दें।" यह समायोजन कृत्रिम रूप से अधिक डेटा बनाए बिना या सामान्य उदाहरणों को फेंके बिना होता है, जिससे मॉडल वास्तविकता की अधिक पूर्ण तस्वीर सीख पाता है।

अपने विचारों का परीक्षण करने के लिए, टीम ने सोशल मीडिया पोस्ट के दो प्रमुख डेटासेट्स पर इस ढांचे को लागू किया, जिनमें ज्ञात संबंधों वाले हजारों टेक्स्ट-इमेज जोड़े शामिल थे। उन्होंने अपने तरीके की तुलना मौजूदा मॉडलों की एक विस्तृत श्रृंखला से की, जिसमें वे मॉडल भी शामिल थे जो केवल टेक्स्ट पर अत्यधिक निर्भर हैं और वे भी जो टेक्स्ट और छवियों को विभिन्न तरीकों से संयोजित करने का प्रयास करते हैं। परिणामों ने दिखाया कि उनके संतुलित दृष्टिकोण ने लगातार दूसरों से बेहतर प्रदर्शन किया। सबसे महत्वपूर्ण बात यह है कि इसने उन दुर्लभ, 'टेल-एंड' संबंधों को पहचानने की कंप्यूटर की क्षमता में काफी सुधार किया जिन्हें पिछले मॉडल अक्सर मिस कर देते थे। एक विशिष्ट परीक्षण में, सिस्टम ने अस्पष्ट संबंधों की पहचान करने में नाटकीय सुधार दिखाया, जिससे सिद्ध हुआ कि उनकी 'डुअल-बैलेंस' रणनीति ने मॉडल को शोर और सामान्य पैटर्न से अभिभूत होने से सफलतापूर्वक रोका।

शोधकर्ताओं ने यह सुनिश्चित करने के लिए कि उनका सिस्टम वही कर रहा है जो वे चाहते थे, आंतरिक रूप से यह भी देखा कि उनका सिस्टम कैसे काम करता है। उन्होंने पाया कि टेक्स्ट और छवियों को संतुलित करने के लिए जिम्मेदार सिस्टम का हिस्सा सफलतापूर्वक भ्रामक विजुअल संकेतों को अनदेखा करना सीख गया जब टेक्स्ट स्पष्ट था, और उन विजुअल सुरागों का उपयोग करना सीख गया जब टेक्स्ट अस्पष्ट था। इसी तरह, सामान्य संबंधों के प्रति पूर्वाग्रह को ठीक करने के लिए जिम्मेदार हिस्से को दिखाया गया कि उसने कंप्यूटर के विश्वास को सामान्य उत्तरों से हटाकर दुर्लभ उत्तरों की ओर स्थानांतरित कर दिया। जब उन्होंने बहुत कम प्रशिक्षण डेटा के साथ सिस्टम का परीक्षण किया, तब भी इसने मानक मॉडलों की तुलना में बेहतर प्रदर्शन किया, जो यह सुझाव देता है कि यह दृष्टिकोण मजबूत और प्रभावी है, भले ही जानकारी कम हो। अध्ययन यह निष्कर्ष निकालता है कि सूचना स्रोतों के असंतुलन और डेटा आवृत्ति के असंतुलन दोनों को एक साथ संबोधित करके, कंप्यूटर सोशल मीडिया पर मानव संचार की जटिल और अव्यवस्थित वास्तविकता को समझने में बहुत बेहतर हो सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →