Challenger at MultiPRIDE: Is It Hate Speech or Reclaimed?
यह शोध पत्र मल्टीप्राइड (MultiPride) साझा कार्य के लिए एक गणनात्मक रूप से कुशल और व्याख्या योग्य दृष्टिकोण प्रस्तुत करता है जो अत्यधिक वर्ग असंतुलन (class imbalance) के बावजूद मजबूत प्रदर्शन प्राप्त करने के लिए घने अर्थपूर्ण एम्बेडिंग (dense semantic embeddings), क्लीनलैब-आधारित लेबल-नॉइज़ फ़िल्टरिंग और एक एमएलपी (MLP) क्लासिफायर को जोड़कर घृणास्पद भाषण (hate speech) को पुनरुद्धारित भाषा (reclaimed language) से अलग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, शोर-शराबे वाले शहर के चौक की तरह है। इस चौक में, लोग कभी-कभी ऐसी बातें चिल्लाते हैं जिनका उद्देश्य दूसरों को चोट पहुँचाना होता है—इसे हेट स्पीच (नफरत भरी भाषा) कहा जाता है। लेकिन इसमें एक मोड़ है: कभी-कभी, जिन लोगों को निशाना बनाया जाता है, वे उन्हीं दर्दनाक शब्दों को वापस ले लेते हैं, उन्हें पकड़ लेते हैं, और आपस में खुद को मजबूत और एकजुट दिखाने के लिए उनका उपयोग करते हैं। इसे रिकलेम्ड लैंग्वेज (पुनर्claimed भाषा) कहा जाता है।
इसे एक पारिवारिक उपनाम की तरह समझें। यदि कोई अजनबी आपके परिवार को किसी मूर्खतापूर्ण नाम से बुलाता है, तो यह एक अपमान है। लेकिन यदि आपका परिवार उसी मूर्खी नाम का उपयोग एक साथ हंसने के लिए करता है, तो यह प्यार का संकेत है। समस्या यह है कि कंप्यूटर के लिए इस अंतर को समझना बहुत कठिन है कि एक अजनबी द्वारा चिल्लाया गया अपमान और एक परिवार के सदस्य द्वारा उपयोग किया गया उपनाम क्या है। वे अक्सर भ्रमित हो जाते हैं और सोचते हैं कि परिवार भी बुरा व्यवहार कर रहा है।
यह पेपर बताता है कि तेब्रीज़ विश्वविद्यालय (University of Tabriz) की एक टीम ने इस विशिष्ट भ्रम को सुलझाने के लिए एक "स्मार्ट जासूस" बनाया, जो MultiPRIDE नामक प्रतियोगिता के लिए था। उन्होंने इसे सरल चरणों में इस प्रकार किया:
1. समस्या: "गलत अलार्म" (The False Alarm)
टीम ने देखा कि कंप्यूटर अक्सर "गलत अलार्म" लगाते हैं। वे एक ऐसा शब्द देखते हैं जो आमतौर पर बुरा होता है (जैसे कोई अपशब्द) और तुरंत उसे हेट स्पीच के रूप में चिह्नित कर देते हैं, भले ही उसका उपयोग LGBTQ+ समुदाय द्वारा एक-दूसरे का समर्थन करने के लिए किया जा रहा हो। यह लोगों को अपनी अभिव्यक्ति करने से रोकता है। लक्ष्य कंप्यूटर को यह सिखाना था कि एक "बुरे व्यक्ति" द्वारा अपशब्द के उपयोग और एक "अच्छे व्यक्ति" द्वारा उसे पुनर्claimed (reclaim) करने के बीच अंतर कैसे किया जाए।
2. समाधान: तीन-चरणीय सफाई प्रक्रिया
टीम ने एक प्रणाली बनाई जो एक हाई-टेक फिल्टर की तरह काम करती है। केवल शब्दों को पढ़ने के बजाय, उन्होंने तीन-चरणीय प्रक्रिया का उपयोग किया:
चरण 1: द जैनिटर (डेटा की सफाई और संवर्धन - Data Cleaning & Augmentation)
सबसे पहले, उन्होंने बिखरे हुए टेक्स्ट को साफ किया। उन्होंने URL, यूजर नेम और इमोजी (जो कंप्यूटर को भ्रमित कर सकते हैं) को हटा दिया, लेकिन हैशटैग को रखा क्योंकि वे महत्वपूर्ण अर्थ रखते हैं।- उपमा: कल्पना कीजिए कि आप एक बिखरे हुए कमरे का अध्ययन करने की कोशिश कर रहे हैं। आप कचरा (URL) फेंक देते हैं लेकिन किताबों (हैशटैग) को रखते हैं क्योंकि वे कहानी बताते हैं।
- मोड़: उन्होंने यह भी देखा कि उनके पास "रिकलेम्ड" भाषा (अल्पसंख्यक वर्ग) के पर्याप्त उदाहरण नहीं थे। इसलिए, उन्होंने इन दुर्लभ उदाहरणों को अन्य भाषाओं (जैसे फ्रेंच या जर्मन) में अनुवाद करने के लिए एक "अनुवाद मशीन" (Google Translate) का उपयोग किया और फिर उन्हें वापस अंग्रेजी में अनुवाद किया। इससे नए, नकली उदाहरण तैयार हुए ताकि कंप्यूटर बेहतर सीख सके, जैसे कि किसी दुर्लभ रेसिपी की अतिरिक्त प्रतियां बनाना ताकि शेफ अधिक अभ्यास कर सके।
चरण 2: द ट्रांसलेटर (एम्बेडिंग्स - Embeddings)
उन्होंने वाक्यों को "सघन मानचित्रों" (dense maps) में बदलने के लिए एक शक्तिशाली उपकरण intfloat/e5-large-v2 का उपयोग किया।- उपमा: केवल शब्दों "I love you" को देखने के बजाय, कंप्यूटर पूरे वाक्य को मानचित्र पर निर्देशांकों (coordinates) के एक जटिल सेट में बदल देता है। यह मानचित्र वाक्य के भाव और संदर्भ को पकड़ता है, न कि केवल शब्दकोश की परिभाषा को। यह कंप्यूटर को समझने में मदद करता है कि एक माता-पिता द्वारा कहे गए "I love you" का अहसास, एक अजनबी द्वारा डरावने तरीके से कहे गए "I love you" से अलग होता है।
चरण 3: क्वालिटी कंट्रोल (लेबल की सफाई - Label Cleaning)
कभी-कभी, डेटा में ही गलतियाँ होती हैं (बुरे लेबल)। टीम ने एक गुणवत्ता निरीक्षक के रूप में Cleanlab नामक टूल का उपयोग किया।- उपमा: कल्पना कीजिए कि एक शिक्षक टेस्ट ग्रेड कर रहा है। यदि शिक्षक को लगता है कि छात्र का उत्तर गलत है लेकिन उत्तर कुंजी कहती है कि वह सही है, तो शिक्षक दोबारा जांच करता है। यदि शिक्षक को यकीन है कि उत्तर कुंजी गलत है, तो वह उस विशिष्ट प्रश्न को टेस्ट से बाहर निकाल देता है ताकि वह बाद में छात्रों को भ्रमित न करे। इस चरण ने प्रशिक्षण डेटा से "शोर वाले" या भ्रमित करने वाले उदाहरणों को हटा दिया।
3. अंतिम मस्तिष्क (द क्लासिफायर - The Classifier)
इस सारी सफाई और अनुवाद के बाद, उन्होंने डेटा को एक मल्टी-लेयर पर्सेप्ट्रॉन (MLP) नामक एक सरल लेकिन प्रभावी "मस्तिष्क" में डाला।
- उपमा: इसे एक हल्के, तेज़ दौड़ने वाले रोबोट के रूप में सोचें। इसे सोचने के लिए सुपरकंप्यूटर की आवश्यकता नहीं है; इसे बस चरण 2 से प्राप्त स्वच्छ, उच्च-गुणवत्ता वाले मानचित्रों की आवश्यकता है ताकि यह एक त्वरित निर्णय ले सके: "क्या यह हेट स्पीच है, या यह रिकलेम्ड भाषा है?"
4. परिणाम: उन्होंने कैसा प्रदर्शन किया?
टीम ने अंग्रेजी, इतालवी और स्पेनिश में ट्वीट्स पर अपने सिस्टम का परीक्षण किया।
- अच्छी खबर: उनका सिस्टम "साफ" हेट स्पीच (लेबल 0) को पहचानने में बहुत अच्छा था। यह स्पष्ट अपमानों के लिए एक सटीक जासूस की तरह था।
- चुनौती: इसे "रिकलेम्ड" भाषा (लेबल 1) के साथ थोड़ा संघर्ष करना पड़ा, विशेष रूप से अंग्रेजी में। ऐसा इसलिए है क्योंकि डेटा में रिकलेम्ड भाषा के उदाहरण शुरू से ही बहुत कम थे (एक समस्या जिसे "क्लास इम्बैलेंस" कहा जाता है)।
- निर्णय: इस असंतुलन के बावजूद, उनका सिस्टम कुल मिलाकर अच्छा प्रदर्शन करता रहा। उन्होंने दिखाया कि इस समस्या को हल करने के लिए आपको एक विशाल, महंगे सुपरकंप्यूटर की आवश्यकता नहीं है; एक स्मार्ट, हल्का सिस्टम अच्छे सफाई चरणों के साथ बहुत अच्छा काम कर सकता है।
सारांश
यह पेपर तर्क देता है कि कंप्यूटर को मित्रवत रिकलेम्ड भाषा को हेट स्पीच के रूप में गलत लेबल करने से रोकने के लिए, हमें चाहिए:
- डेटा को सावधानीपूर्वक साफ करना।
- दुर्लभ मामलों के अधिक उदाहरण बनाने के लिए स्मार्ट अनुवाद का उपयोग करना।
- गलतियों के लिए डेटा की दोबारा जांच करना।
- अंतिम निर्णय लेने के लिए एक सरल, तेज़ मॉडल का उपयोग करना।
उन्होंने साबित किया कि यह "लाइटवेट" दृष्टिकोण विभिन्न भाषाओं में अच्छी तरह से काम करता है, जो भारी कंप्यूटिंग शक्ति की आवश्यकता के बिना ऑनलाइन भाषण की जटिल बारीकियों को संभालने का एक व्यावहारिक तरीका प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।