Improving Implicit Hate Speech Detection via a Community-Driven Multi-Agent Framework
यह शोध पत्र एक समुदाय-संचालित मल्टी-एजेंट फ्रेमवर्क पेश करता है जो एक केंद्रीय मॉडरेटर एजेंट और गतिशील रूप से निर्मित कम्युनिटी एजेंटों का लाभ उठाता है ताकि सामाजिक-सांस्कृतिक संदर्भ को एकीकृत किया जा सके, जिससे टॉक्सीजेन (ToxiGen) डेटासेट पर मौजूदा प्रॉम्प्टिंग विधियों की तुलना में निहित घृणास्पद भाषण (implicit hate speech) का पता लगाने की सटीकता और निष्पक्षता दोनों में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरे शहर के चौक (टाउन स्क्वायर) की तरह है। इस चौक में, लोग लगातार संदेश चिल्ला रहे हैं। अधिकांश संदेश मिलनसार हैं, लेकिन कुछ लोग चालाकी भरी, कूटबद्ध (कोडेड) भाषा का उपयोग करके दूसरों को चोट पहुँचाने की कोशिश कर रहे हैं जो सतह पर तो निर्दोष लगती है लेकिन वास्तव में नफरत से भरी होती है।
समस्या यह है कि "सुरक्षा गार्ड" (कंप्यूटर प्रोग्राम जिनका वर्तमान में पोस्ट की निगरानी के लिए उपयोग किया जाता है) अक्सर बहुत शाब्दिक होते हैं। वे उन गार्डों की तरह हैं जो केवल स्पष्ट अपशब्दों के लिए लोगों को गिरफ्तार करते हैं। यदि कोई किसी समूह का अपमान करने के लिए सूक्ष्म मजाक या ऐतिहासिक संदर्भ का उपयोग करता है, तो गार्ड उसे चूक जाते हैं। वे निर्दsgemित लोगों को गलती से गिरफ्तार करने (फॉल्स पॉजिटिव) से इतने डरे हुए हैं कि वे बहुत सारे वास्तविक दबंगों को बिना पकड़े जाने देते हैं (फॉल्स नेगेटिव)।
यहाँ बताया गया है कि वारसॉ यूनिवर्सिटी ऑफ टेक्नोलॉजी के शोधकर्ताओं ने इसे कैसे ठीक करने का प्रस्ताव दिया है, एक "समुदाय-संचालित" (कम्युनिटी-ड्रिवन) AI एजेंटों की टीम का उपयोग करके।
पुराना तरीका: अकेला भेड़िया गार्ड (The Lone Wolf Guard)
वर्तमान में, अधिकांश सिस्टम एक एकल AI (जैसे एक अकेले सुरक्षा गार्ड) का उपयोग करते हैं जो किसी पोस्ट को पढ़ता है और यह तय करता है कि वह नफरत भरा भाषण (हेट स्पीच) है या नहीं। इस गार्ड को स्मार्ट बनाने के लिए, शोधकर्ताओं ने इसे विभिन्न "निर्देश नियमावली" (प्रॉम्प्ट्स) देने का प्रयास किया है:
- ज़ीरो-शॉट (Zero-shot): बस गार्ड को बताना, "क्या यह नफरत है?"
- फ्यू-शॉट (Few-shot): गार्ड को पहले नफरत भरे भाषण के कुछ उदाहरण दिखाना।
- चेन-ऑफ-थॉट (Chain-of-Thought): गार्ड से निर्णय लेने से पहले "सोचने के लिए" (स्टेप-बाय-स्टेप) कहना।
पेपर में पाया गया कि जबकि ये तरीके थोड़ा मदद करते हैं, अकेला गार्ड अभी भी जटिल, कूटबद्ध भाषा के साथ संघर्ष करता है। वे अक्सर नफरत को पहचान नहीं पाते क्योंकि उनके पास मजाक को समझने के लिए विशिष्ट सांस्कृतिक संदर्भ की कमी होती है।
नया तरीका: "परामर्शदात्री टाउन हॉल" (The Consultative Town Hall)
लेखक एक नया सिस्टम प्रस्तावित करते हैं जो एक अकेले गार्ड के बजाय एक टाउन हॉल मीटिंग की तरह काम करता है।
- मॉडरेटर एजेंट (मुख्य गार्ड): यह AI पहले पोस्ट को पढ़ता है। यदि पोस्ट स्पष्ट रूप से घृणास्पद या स्पष्ट रूप से निर्दोष है, तो यह त्वरित निर्णय लेता है।
- "अनिश्चितता" का क्षण: यदि पोस्ट पेचीदा, अस्पष्ट या कूटबद्ध भाषा का उपयोग करती है, तो मुख्य गार्ड "पॉज" बटन दबा देता है। यह स्वीकार करता है, "मैं इस बारे में अनिश्चित हूँ।"
- सामुदायिक एजेंट (पड़ोस के विशेषज्ञ): यही जादुगरिक हिस्सा है। अनुमान लगाने के बजाय, सिस्टम स्वचालित रूप से कम्युनिटी एजेंटों की एक टीम को बुलाता है।
- कल्पना कीजिए कि एक पोस्ट किसी विशिष्ट समूह को लक्षित करती है (जैसे, एशियाई लोगों के बारे में एक सूक्ष्म मजाक)। सिस्टम तुरंत एक "एशियन कम्युनिटी एजेंट" को बुला लेता है।
- वे क्या कहें, यह उन्हें कैसे पता चलता है? ये एजेंट केवल अनुमान नहीं लगा रहे हैं। उन्हें उस विशिष्ट समूह के इतिहास, संस्कृति और संघर्षों के बारे में विकिपीडिया से वास्तविक, तथ्यात्मक जानकारी निकालने के लिए सिस्टम द्वारा बनाया गया है।
- उपमा: यह एक स्थानीय इतिहासकार से पूछने जैसा है, "हे, मैं यह वाक्यांश देख रहा हूँ। क्या इसका आपके समुदाय के इतिहास में कोई छिपा हुआ अर्थ है?"
- अंतिम निर्णय: मुख्य गार्ड विशेषज्ञ की सलाह सुनता है, अपने स्वयं के दृष्टिकोण के साथ उसे जोड़ता है, और एक अंतिम, बहुत अधिक स्मार्ट निर्णय लेता है।
यह क्यों महत्वपूर्ण है (परिणाम)
शोधकर्ताओं ने इस सिस्टम का परीक्षण ToxiGen नामक एक डेटासेट पर किया, जो ब्लैक लोगों, एशियाई लोगों, मुसलमानों, यहूदियों, महिलाओं और LGBTQ+ समुदाय जैसे समूहों को लक्षित करने वाले इन पेचीदा, अंतर्निहित (इम्प्लिसिट) हेट स्पीच के उदाहरणों से भरा है।
यहाँ हुआ क्या:
- बेहतर पहचान: नए सिस्टम ने पुराने "अकेले गार्ड" के तरीकों की तुलना में काफी अधिक वास्तविक नफरत भरे भाषण को पकड़ा। इसने केवल अनुमान नहीं लगाया; इसने संदर्भ को समझा।
- निष्पक्षता: पुराने सिस्टम "यह सुरक्षित है" (ट्रू नेगेटिव) कहने में बहुत अच्छे थे लेकिन "यह नफरत है" (ट्रू पॉजिटिव) कहने में बहुत खराब थे। नए सिस्टम ने इसे संतुलित कर दिया। यह निर्दोष लोगों को गलती से दंडित किए बिना, नफरत को पहचानने में बहुत बेहतर हो गया।
- "एब्लेशन" टेस्ट (The Ablation Test): शोधकर्ताओं ने सामुदायिक एजेंटों के बिना (केवल मुख्य गार्ड के साथ) सिस्टम को चलाने का प्रयास किया। प्रदर्शन नाटकीय रूप रूप से गिर गया, जिससे साबित हुआ कि "विशेषज्ञ परामर्श" ही सफलता की कुंजी थी।
पेपर से एक वास्तविक दुनिया का उदाहरण
पेपर एक बेहतरीन उदाहरण देता है कि यह क्यों काम करता है:
- पोस्ट: "यदि आप हाल ही में फिल्मों में गए हैं, तो आप देखेंगे कि मूवी थिएटर के काउंटर और सफाई करने वाले अधिकांश लोग एशियाई हैं।"
- पुराना गार्ड: यह सोच सकता है, "यह तो बस एक अवलोकन है। कोई नफरत भरे शब्द नहीं हैं। सुरक्षित।"
- नया सिस्टम: "एशियन कम्युनिटी एजेंट" (ऐतिहासिक रूढ़ियों के ज्ञान से लैस) इसे इस विचार को सुदृढ़ करने के रूप में पहचानता है कि एशियाई लोग केवल सेवा कार्यों के लिए उपयुक्त हैं। यह इसे नफरत भरे भाषण के रूप में चिह्नित करता है क्योंकि यह शब्दों के बजाय सामाजिक संदर्भ को समझता है।
निचोड़ (The Bottom Line)
यह पेपर यह दावा नहीं करता है कि यह सभी इंटरनेट समस्याओं को हल कर देगा, लेकिन यह हम द्वारा लक्षित लोगों के विशिष्ट इतिहास और संस्कृति को समझने वाले "डिजिटल सामुदायिक विशेषज्ञों" से मदद मांगने के तरीके के लिए एक विशिष्ट, व्यावहारिक अपग्रेड प्रदान करता है। यह AI को एक कठोर नियम-पालक से बदलकर एक विचारशील, संदर्भ-जागरूक प्रतिभागी बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।