← नवीनतम पेपर
💬 NLP

SAFE-MEME: Structured Reasoning Framework for Robust Hate Speech Detection in Memes

यह शोध पत्र दो नए सूक्ष्म मल्टीमॉडल हेट स्पीच डेटासेट्स (MHS और MHS-Con) के साथ Q&A और पदानुक्रमित (hierarchical) वेरिएंट्स वाले एक संरचित तर्क ढांचे SAFE-MEME को प्रस्तुत करता है, ताकि मीम्स में घृणास्पद भाषण का पता लगाने के लिए एक मजबूत ढांचा तैयार किया जा सके जो क्लोज्ड-सोर्स मॉडल्स की बराबरी करता है और मौजूदा ओपन-सोर्स बेसलाइन्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Palash Nandi, Shivam Sharma, Tanmoy Chakraborty

प्रकाशित 2026-07-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Palash Nandi, Shivam Sharma, Tanmoy Chakraborty

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, अराजक डिजिटल चौक है जहाँ हर कोई चिल्ला रहा है, फुसफुसा रहा है और दीवारों पर चित्र बना रहा है। इस शहर में, एक "मीम" (meme) एक गुप्त हाथ मिलाने (handshake) जैसा है जो एक तस्वीर और एक कैप्शन से बना होता है। कभी-कभी, यह सिर्फ एक बिल्ली के बारे में एक मज़ेदार चुटकुला होता है। लेकिन अन्य समय में, यह एक ट्रोजन हॉर्स (Trojan horse) की तरह होता है: एक तस्वीर जो मासूम दिखती है, जिसके साथ एक कैप्शन है जो हानिरहित लगता है, लेकिन साथ मिलकर वे एक छिपा हुआ, ज़हरीला संदेश ले जाते हैं जिसका उद्देश्य किसी विशिष्ट समूह को चोट पहुँचाना है। इसे "हेट स्पीच" (नफरत भरे भाषण) कहा जाता है, और जब यह मीम के अंदर छिप जाता है, तो इसे पकड़ना अविश्वसनीय रूपamente कठिन हो जाता है क्योंकि नफरत अकेले शब्दों में नहीं है, या अकेले चित्र में नहीं है—यह दोनों के चालाकी भरे संयोजन में है।

लंबे समय तक, इस डिजिटल चौक की निगरानी करने वाले कंप्यूटर ऐसे सुरक्षा गार्डों की तरह रहे हैं जो केवल टेक्स्ट को पढ़ते हैं या केवल चित्र को देखते हैं। वे उस मज़ाक को मिस कर देते हैं जो मज़ाक नहीं है, या उस अपमान को जो प्रशंसा के रूप में छिपा हुआ है। वे "इम्प्लिसिट" (अंतर्निहित) नफरत को समझने में संघर्ष करते हैं, जो एक ऐसी फुसफुसाहट की तरह है जिसका अर्थ तभी समझ आता है जब आप शहर के गुप्त इतिहास को जानते हों। बड़ा सवाल जो शोधकर्ताओं ने पूछा है वह यह है: क्या हम कंप्यूटरों को केवल सतह को देखने के बजाय यह सोचना सिखा सकते हैं कि एक मीम का वास्तव में क्या अर्थ है, ठीक वैसे ही जैसे एक इंसान करेगा?

यह शोध पत्र डिजिटल जासूसों की एक नई टीम पेश करता है जिसे SAFE-MEME कहा जाता है। केवल एक मीम को स्कैन करने और "नफरत!" या "सुरक्षित!" चिल्लाने के बजाय, SAFE-Meme एक जिज्ञासु किशोर की तरह व्यवहार करता है जो चीजों को ऊपरी तौर पर स्वीकार करने से इनकार कर देता है। यह एक विशेष "स्ट्रक्चर्ड रीजनिंग" (संरचित तर्क) तकनीक का उपयोग करता है, जो बिल्कुल वैसा ही है जैसे एक जासूस निष्कर्ष निकालने से पहले प्रश्नों की एक श्रृंखला पूछकर रहस्य सुलझाता है।

शोधकर्ताओं ने अपने जासूसों के लिए दो नए प्रशिक्षण मैदान बनाए। पहला, जिसे MHS कहा जाता है, "एक्सप्लिसिट हेट" (स्पष्ट अपमान), "इम्प्लिसिट हेट" (छिपा हुआ अपमान), या "बेनाइन" (हानिरहित) के रूप में लेबल किए गए मीम्स का एक पुस्तकालय है। दूसरा, MHS-Con, एक स्ट्रेस टेस्ट है जिसे कंप्यूटरों को चकमा देने के लिए डिज़ाइन किया गया है। यह एक ही चित्र को तीन अलग-अलग कैप्शन के साथ जोड़ता है: एक जो स्पष्ट रूप से घृणास्पद है, एक जो चालाकी से घृणास्पद है, और एक जो पूरी तरह से निर्दोष है। यह सेटअप एक जासूस को एक व्यक्ति की फोटो दिखाने और फिर पूछने जैसा है, "क्या यह व्यक्ति नायक है, खलनायक है, या सिर्फ एक पड़ोसी है?" इस आधार पर कि आप उनके बारे में क्या कहानी सुनाते हैं।

शोध पत्र दो संस्करणों वाले SAFE-MEME जासूस का परीक्षण करता है:

  1. SAFE-MEME-QA: यह संस्करण "प्रश्न और उत्तर" का खेल खेलता है। जब यह एक मीम देखता है, तो यह केवल अनुमान नहीं लगाता। यह खुद से सवाल पूछता है जैसे, "यह किसे निशाना बना रहा है?" और "यह किस प्रकार की नफरत है?" यह जवाबों को लिखता है, निर्णय लेने से पहले तर्क की एक श्रृंखला बनाता है।
  2. SAFE-MEME-H: यह संस्करण एक ऐसे लाइब्रेरियन की तरह है जो पहले चित्र का विस्तार से वर्णन करता है और फिर मीम को श्रेणियों के पदानुक्रम (hierarchy) में वर्गीकृत करता है (क्या यह घृणास्पद है? यदि हाँ, तो क्या यह स्पष्ट है या छिपा हुआ है?)।

परिणाम एक सरप्राइज पार्टी की तरह हैं। जब उनके जासूसों ने मीम्स के मानक पुस्तकालय (MHS) का सामना किया, तो लाइब्रेरियन-शैली वाले जासूस (SAFE-MEME-H) स्टार प्लेयर रहे। इसने बेहतरीन ओपन-सोर्स कंप्यूटर मॉडलों को एक ठोस अंतर से पीछे छोड़ दिया, जिससे यह साबित हुआ कि चरण-दर-चरण, पदानुक्रमित दृष्टिकोण सूक्ष्म, छिपी हुई नफरत को पहचानने के लिए अच्छा काम करता है। हालाँकि, जब वे ट्रिकी स्ट्रेस टेस्ट (MHS-Con) में गए, जहाँ एक ही छवि को तीन बहुत अलग कहानियों के विरुद्ध आंका जाना था, तो प्रश्न-और-उत्तर वाला जासूस (SAFE-MEME-QA) बढ़त बनाने में सफल रहा। इसने अन्य ओपन-सोर्स मॉडलों से लगभग 5% बेहतर प्रदर्शन किया और भ्रमित करने वाले मामलों को अपने भाई (sibling) की तुलना में बहुत बेहतर तरीके से संभाला।

दिलचस्प बात यह है कि शोध पत्र ने पाया कि सबसे शक्तिशाली "क्लोज्ड-सोर्स" मॉडल (बड़ी टेक कंपनियों के सुपर-स्मार्ट, महंगे AI सिस्टम) अक्सर बहुत सतर्क थे। वे बहुत सारी छिपी हुई, अंतर्निहित नफरत को मिस कर गए क्योंकि वे गलती करने से डरते थे। दूसरी ओर, एक साधारण टेक्स्ट-ओनली मॉडल (T5-large) ने स्ट्रेस टेस्ट पर आश्चर्यजनक रूप से अच्छा प्रदर्शन किया, लेकिन केवल इसलिए क्योंकि स्ट्रेस टेस्ट काफी हद तक स्पष्ट शब्दों पर निर्भर था। हालाँकि, SAFE-MEME जासूसों ने दिखाया कि वे वास्तव में संदर्भ को समझ सकते हैं, न कि केवल शब्दों को।

शोधकर्ताओं ने यह भी देखा कि उनके जासूसों ने कहाँ गलतियाँ कीं। कभी-कभी, AI उन दुर्लभ समूहों के कारण भ्रमित हो जाता था जिन्हें उसने अपने प्रशिक्षण में पर्याप्त रूप से नहीं देखा था, या वह विभिन्न सांस्कृतिक संदर्भों को मिला देता था। यह एक ऐसे जासूस की तरह है जो एक पड़ोस के बारे में बहुत कुछ जानता है लेकिन दूसरे पड़ोस में खो जाता है। शोध पत्र निष्कर्ष निकालता है कि जबकि SAFE-MEME हमें कंप्यूटरों को मीम्स को केवल "देखने" के बजाय उनके बारे में "सोचने" के बारे में सिखाने की दिशा में एक बड़ी प्रगति है, इसमें अभी भी उस डेटा के पूर्वाग्रह शामिल हैं जिस पर इसे प्रशिक्षित किया गया था। यह अभी भी एक पूर्ण समाधान नहीं है, लेकिन यह हमारे पास मौजूद पहले के तरीकों की तुलना में डिजिटल चौक को देखने का एक बहुत अधिक स्मार्ट तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →