← नवीनतम पेपर
💬 NLP

MEME-Fusion@CHiPSAL 2026: Multimodal Ablation Study of Hate Detection and Sentiment Analysis on Nepali Memes

यह शोध पत्र MEME-Fusion को प्रस्तुत करता है, जो एक हाइब्रिड क्रॉस-मोडल अटेंशन आर्किटेक्चर है जो CLIP और BGE-M3 एनकोडिंग्स को गतिशील रूप से संलयित (fuse) करके कम-संसाधन वाले नेपाली मीम्स में घृणास्पद भाषण और भावना का पता लगाने में केवल टेक्स्ट-आधारित बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करता है, साथ ही देवनागरी लिपि वाले, डेटा-दुर्लभ वातावरण में अंग्रेजी-केंद्रित विजन मॉडल्स और मानक एंसेम्बल्स की महत्वपूर्ण सीमाओं को भी उजागर करता है।

मूल लेखक: Samir Wagle, Reewaj Khanal, Abiral Adhikari

प्रकाशित 2026-04-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Samir Wagle, Reewaj Khanal, Abiral Adhikari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अराजक डिजिटल टाउन स्क्वायर के मॉडरेटर हैं। इस चौक में, लोग केवल शब्द नहीं चिल्ला रहे हैं; वे मीम्स (memes) पोस्ट कर रहे हैं। ये मीम्स एक अंदरूनी चुटकुलों की तरह हैं जो एक तस्वीर में लिपटे होते हैं, जहाँ टेक्स्ट और इमेज मिलकर एक संदेश देते हैं। कभी-कभी, वह संदेश मज़ेदार होता है; अन्य समय में, वह नफरत फैलाने वाली भाषा (hate speech) होता है।

आपका काम नफरत को पहचानना है। लेकिन एक पेंच है: टाउन स्क्वायर नेपाली (देवनागरी लिपि का उपयोग करते हुए) बोल रहा है, और आपके पास केवल उदाहरणों की एक छोटी सी, फटी-पुरानी नोटबुक (लगभग 850 पोस्ट) है जिससे आपको सीखना है। आपके पास मौजूद अधिकांश AI टूल्स अंग्रेजी और पश्चिमी चित्रों पर प्रशिक्षित हैं, इसलिए वे स्थानीय लिपि और संस्कृति को देखकर भ्रमित हो जाते हैं।

यह शोध पत्र इस कहानी के बारे में है कि कैसे शोधकर्ताओं की एक टीम ने इस विशिष्ट समस्या को हल करने के लिए एक नया "जासूस" बनाया। यहाँ उनकी यात्रा का विवरण दिया गया है:

1. समस्या: "अंधा" जासूस

शोधकर्ताओं ने मानक AI टूल्स का उपयोग करने की कोशिश की, लेकिन उन्हें दो बड़ी दीवारों का सामना करना पड़ा:

  • भाषा की बाधा: प्रसिद्ध AI "आंखें" (जिन्हें CLIP कहा जाता है) एक ऐसे पर्यटक की तरह हैं जिसे केवल अंग्रेजी आती है। जब वे एक नेपाली मीम देखते हैं, तो वे साइन पर लिखे शब्दों को नहीं पढ़ पाते। वे केवल आकृतियों और रंगों को देखते हैं, और अंदाज़ा लगाते रहते हैं। वास्तव में, जब टीम ने AI को केवल चित्रों को देखने दिया, तो इसका प्रदर्शन एक डार्टबोर्ड पर तीर फेंकने वाले बंदर से बेहतर नहीं था।
  • डेटा की कमी: आमतौर पर, AI लाखों किताबें पढ़कर सीखता है। यहाँ, टीम के पास केवल कुछ सौ पन्ने थे। यदि आप बहुत कम डेटा के साथ एक जटिल AI को सिखाने की कोशिश करते हैं, तो वह भ्रमित हो जाता है और "चीटिंग" (overfitting) करने लगता है, यानी नियमों को सीखने के बजाय कुछ ही उदाहरणों को रट लेता है।

2. समाधान: "डायनामिक डुओ" जासूस

एक बड़े, भ्रमित दिमाग के बजाय, उन्होंने एक हाइब्रिड जासूस (Hybrid Detective) बनाया जिसके दो साथी आपस में बात करते हैं:

  • साथी A (पाठक): नेपाली टेक्स्ट का विशेषज्ञ जो शब्दों, स्लैंग और इमोजी को समझ सकता है।
  • साथी B (अवलोकनकर्ता): छवियों का विशेषज्ञ जो चेहरों, रंगों और लेआउट को देखता है।

सीक्रेट सॉस: "गेटिंग नेटवर्क" (Gating Network)
अधिकांश AI सिस्टम बस टेक्स्ट और इमेज को डेटा के एक बड़े ढेर में मिला देते हैं। इस टीम ने कुछ अधिक स्मार्ट किया। उन्होंने दोनों साथियों के बीच एक ट्रैफिक पुलिस (एक "गेटिंग नेटवर्क") जोड़ा।

  • यदि टेक्स्ट स्पष्ट रूप से नफरत फैलाने वाली भाषा है (जैसे कि कोई सीधा अपशब्द), तो ट्रैफिक पुलिस कहती है, "तस्वीर को अनदेखा करें, शब्द ही असली सबूत हैं!"
  • यदि टेक्स्ट अस्पष्ट है लेकिन तस्वीर एक नफरत भरे प्रतीक को दिखाती है, तो ट्रैफिक पुलिस कहती है, "शब्द शांत हैं, लेकिन तस्वीर चिल्ला रही है! तस्वीर पर ध्यान दें!"

यह सिस्टम को हर एक मीम के लिए अलग से अनुकूलित होने की अनुमति देता है, न कि "एक ही नियम सबके लिए" वाला दृष्टिकोण अपनाता है।

3. आश्चर्यजनक खोजें

टीम ने यह देखने के लिए प्रयोग किए कि क्या काम करता है और क्या विफल होता है। उन्होंने कुछ विरोधाभासी सच्चाइयां पाईं:

  • एन्सेम्बल्स (Ensembles) हमेशा मदद नहीं करते: आमतौर पर, यदि आप तीन विशेषज्ञों की राय मांगते हैं और उनके औसत को लेते हैं, तो आपको एक बेहतर उत्तर मिलता है। लेकिन बहुत कम डेटा के साथ, तीनों विशेषज्ञ एक ही तरह की गलतियाँ करते हैं। गलतियों को काटने के बजाय, वे उन्हें बढ़ा देते हैं। यह ऐसा था जैसे तीन लोगों से, जो चश्मा पहनना भूल गए हैं, एक धुंधले साइन का वर्णन करने के लिए कहना; वे बस गलत विवरण पर सहमत हो गए।
  • सटीकता एक जाल है: "केवल-टेक्स्ट" वाला जासूस वास्तव में कुल मिलाकर सही अनुमान लगाने में (72% सटीकता के साथ) "हाइब्रिड" जासूस से अधिक सटीक था। लेकिन, टेक्स्ट-केवल जासूस ने सब कुछ के लिए "नफरत" (Hate) का अनुमान लगाकर चीटिंग की थी, क्योंकि उनके छोटे डेटासेट में अधिकांश मीम्स को 'हेट' के रूप में लेबल किया गया था। उसने निर्दोष मीम्स को पूरी तरह से मिस कर दिया। हाइब्रिड जासूस कुल मिलाकर थोड़ा कम "सटीक" था लेकिन वह बहुत अधिक निष्पक्ष था, जिसने नफरत को भी पकड़ा और निर्दोष पोस्टों को भी सही ढंग से पहचाना। वास्तविक दुनिया में, कच्ची अनुमान लगाने की गति से अधिक निष्पक्षता मायने रखती है।

4. परिणाम

टीम ने अपने हाइब्रिड जासूस को एक वैश्विक प्रतियोगिता (CHiPSAL 2026) में उतारा।

  • नफरत फैलाने वाली भाषा (Hate Speech) खोजने के लिए: वे चौथे स्थान पर आए।
  • सेंटिमेंट (खुश/तटस्थ/दुखी) का विश्लेषण करने के लिए: वे पांचवें स्थान पर आए।

इससे भी महत्वपूर्ण बात यह है कि उनके सिस्टम ने साबित कर दिया कि जब आपके पास बहुत कम डेटा और एक जटिल भाषा हो, तो आप केवल बड़े, महंगे AI मॉडल नहीं थोप सकते। आपको एक स्मार्ट, लचीली प्रणाली की आवश्यकता होती है जो जानती हो कि कब शब्दों पर भरोसा करना है और कब तस्वीर पर।

मुख्य निष्कर्ष (The Takeaway)

यह शोध पत्र हमें सिखाता है कि कम-संसाधन वाली भाषाओं (जैसे नेपाली) की दुनिया में, संदर्भ (Context) ही सर्वोपरि है। आप केवल एक अंग्रेजी AI को ट्रांसलेट करके यह उम्मीद नहीं कर सकते कि वह काम करेगा। आपको एक ऐसी प्रणाली की आवश्यकता है जो स्थानीय संस्कृति को समझती हो, जो जानती हो कि कब टेक्स्ट पर चित्र से अधिक भरोसा करना है (और इसके विपरीत), और जो छोटे डेटासेट से न छले।

यह एक बच्चे को "स्टॉप साइन" पहचानने के बारे में सिखाने जैसा है। आप उसे केवल लाल अष्टकोण की तस्वीर नहीं दिखाते; आपको यह भी समझाना पड़ता है कि इस विशेष मोहल्ले में, साइन दीवार पर बना हो सकता है, या टेक्स्ट अलग भाषा में हो सकता है, लेकिन अर्थ वही रहता है। यही वह चीज़ है जो यह "हाइब्रिड फ्यूजन" सिस्टम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →