SoftHateBench: Evaluating Moderation Models Against Reasoning-Driven, Policy-Compliant Hostility
यह शोध पत्र SoftHateBench प्रस्तुत करता है, जो 28 लक्षित समूहों के विरुद्ध तर्क-संचालित 'सॉफ्ट-हेट स्पीच' (मृदु-घृणा भाषण) बनाने के लिए 'आर्ग्युमेंटम मॉडल ऑफ टॉपिक्स' और 'रिलिवेंस थ्योरी' का उपयोग करने वाला एक जनरेटिव बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडरेशन सिस्टम तब शत्रुता का पता लगाने में विफल रहते हैं जब इसे प्रत्यक्ष अपशब्दों के बजाय सूक्ष्म, नीति-अनुपालक तर्कों के माध्यम से व्यक्त किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ SoftHateBench पेपर का स्पष्टीकरण दिया गया, जिसे रोज़मर्रा के उदाहरणों (analogies) का उपयोग करके सरल अवधारणाओं में विभाजित किया गया है।
बड़ी समस्या: "भेड़ की खाल में भेड़िया"
कल्पना कीजिए कि आप एक क्लब के सुरक्षा गार्ड हैं। आपका काम उन लोगों को रोकना है जो बदतमीजी या खतरनाक व्यवहार कर रहे हैं।
- Hard Hate (कठोर घृणा): यह वैसा ही है जैसे कोई अंदर आए और उसके पास एक बोर्ड हो जिस पर लिखा हो, "मुझे सब से नफरत है!" या वह चिल्लाकर अपशब्द कह रहा हो। यह बहुत स्पष्ट है। आपका सुरक्षा तंत्र (और आपकी आँखें) इसे तुरंत पकड़ लेता है।
- Soft Hate (कोमल घृणा): यह पेचीदा हिस्सा है। कल्पना कीजिए कि कोई अंदर आता है, सूट पहने हुए, बहुत विनम्रता से बात कर रहा है और कह रहा है, "मैं बस सुरक्षा और परंपरा को लेकर चिंतित हूँ।" वह बुरे शब्दों का प्रयोग नहीं कर रहा है, लेकिन उसका तर्क (logic) इस तरह बनाया गया है कि आपको विश्वास हो जाए कि किसी विशेष समूह को बाहर निकाल देना चाहिए। वह अपनी शत्रुता को छिपाने के लिए "तर्क" का उपयोग कर रहा है।
यह पेपर तर्क देता है कि वर्तमान AI सुरक्षा उपकरण "चिल्लाने वालों" (Hard Hate) को पकड़ने में तो माहिर हैं, लेकिन "विनम्र हेरफेर करने वालों" (Soft Hate) को पकड़ने में बहुत खराब हैं। वे खतरे को इसलिए नहीं देख पाते क्योंकि शब्द अपने आप में हानिरहित दिखते हैं।
समाधान: एक नया "तनाव परीक्षण" (SoftHateBench)
शोधकर्ताओं ने SoftHateBench नामक एक नया परीक्षण मैदान बनाया है। इसे AI सुरक्षा मॉडलों के लिए एक "ड्राइविंग टेस्ट" की तरह समझें, लेकिन यहाँ यह परीक्षण नहीं किया जा रहा कि क्या वे कार को रोक सकते हैं, बल्कि यह परीक्षण किया जा रहा है कि क्या AI उस ड्राइवर को पहचान सकता है जो सभी ट्रैफिक नियमों का पूरी तरह से पालन करते हुए भी खतरनाक तरीके से गाड़ी चला रहा है।
उन्होंने ये उदाहरण केवल इंटरनेट से नहीं ढूँढे; उन्होंने इन्हें बनाया है। उन्होंने स्पष्ट रूप से घृणास्पद बयानों को लिया और उन्हें एक विशेष रेसिपी का उपयोग करके "सॉफ्ट हेट" संस्करणों में फिर से लिखा, जो सुनने में तर्कसंगत लगते हैं लेकिन उनमें वही घृणास्पद लक्ष्य समाहित है।
उन्होंने इसे कैसे बनाया: "रिवर्स इंजीनियरिंग" की रेसिपी
इन पेचीदा उदाहरणों को बनाने के लिए, लेखकों ने दो मुख्य उपकरणों का उपयोग किया, जैसे एक शेफ एक विशिष्ट चाकू और एक विशिष्ट ओवन का उपयोग करता है:
- द आर्गुमेंट मैप (AMT): कल्पना कीजिए कि एक जासूस अपराध को सुलझाने की कोशिश कर रहा है। आमतौर पर, आप सुराग (साक्ष्य) देखते हैं और निष्कर्ष निकालते हैं।
- सामान्य तरीका: सुराग A + सुराग B = निष्कर्ष।
- उनका तरीका: उन्होंने निष्कर्ष (जैसे, "इस समूह को प्रतिबंधित किया जाना चाहिए") से शुरुआत की और पीछे की ओर काम करते हुए ऐसे सुरागों का आविष्कार किया जो एक तर्कसंगत व्यक्ति को उसी निष्कर्ष तक ले जाएँ। उन्होंने एक तार्किक पुल बनाया जो दिखने में तो ठोस है, लेकिन उसकी नींव घृणा पर टिकी है।
- "रेलेवेंस" फ़िल्टर (Relevance Theory): यह एक ऐसे फ़िल्टर की तरह है जो यह सुनिश्चित करता है कि कहानी स्वाभाविक और समझने में आसान लगे। यह सुनिश्चित करता है कि AI कुछ ऐसा न लिखे जो रोबोटिक या भ्रमित करने वाला लगे। यह "सॉफ्ट हेट" को एक सामान्य, समझदारी भरी राय जैसा बनाता है जिसे आप किसी डिनर पार्टी में सुन सकते हैं।
उन्होंने इन उदाहरणों को बनाने के लिए इस पद्धति का उपयोग किया और कुल 4,745 अलग-अलग उदाहरण बनाए, जो 28 विभिन्न समूहों (जैसे अप्रवासी, विभिन्न धर्म या राजनीतिक समूह) को कवर करते हैं। इसके बाद, उन्होंने इन उदाहरणों को और भी कठिन बनाने के लिए इसमें "धुंध" (अस्पष्ट भाषा) जोड़ी ताकि यह देखा जा सके कि क्या AI अभी भी इसके पार देख सकता है।
परिणाम: AI को चकमा दिया गया
शोधकर्ताओं ने कई अलग-अलग AI मॉडलों (जो "सुरक्षा गार्ड" हैं) का इस नए परीक्षण के विरुद्ध परीक्षण किया।
- परिणाम: AI मॉडल "चिल्लाने वालों" (Hard Hate) को पकड़ने में उत्कृष्ट थे। लेकिन जैसे ही घृणा को एक "तर्कसंगत तर्क" के रूप में छिपाया गया (Soft Hate), AI का प्रदर्शन धड़ाम से गिर गया।
- गिरावट: कुछ मॉडल जो स्पष्ट घृणा को 90% तक पकड़ लेते थे, वे "सॉफ्ट" घृणा को केवल 20% ही पकड़ पाए।
- कारण: AI "बुरे शब्दों" (जैसे अपशब्द या गाली) की तलाश कर रहा था। जब उन बुरे शब्दों को "अच्छे शब्दों" (जैसे "सुरक्षा," "परंपरा," या "समुदाय") से बदल दिया गया, तो AI ने सोचा कि सब कुछ ठीक है।
"मैजिक ग्लासेस" (जादुई चश्मे) की खोज
पेपर का सबसे दिलचस्प हिस्सा यहाँ है। शोधकर्ताओं ने पूछा: "AI विफल क्यों हुआ? क्या वह मूर्ख है, या वह सिर्फ नक्शा भूल गया है?"
उन्होंने AI को एक संकेत दिया। केवल विनम्र टेक्स्ट दिखाने के बजाय, उन्होंने AI को वे छिपे हुए तार्किक चरण दिखाए जिनका उपयोग उन्होंने तर्क बनाने के लिए किया था (अर्थात "आर्गुमेंट मैप" के हिस्से)।
- नक्शे के बिना: AI विफल रहा।
- नक्शे के साथ: AI अचानक घृणा को पहचानने में बहुत बेहतर हो गया।
उपमा (Analogy): यह एक जासूस को अपराध स्थल दिखाने जैसा है। बिना नक्शे के, वे एक साफ कमरा देखते हैं और सोचते हैं, "यहाँ कोई अपराध नहीं हुआ।" लेकिन यदि आप उन्हें एक नक्शा देते हैं जो दिखाता है कि यदि कोई अंदर आया होता तो उसके पैरों के निशान कहाँ होते, तो वे अचानक अपराध को देख सकते हैं।
निष्कर्ष
यह पेपर निष्कर्ष निकालता है कि हम केवल "बुरे शब्दों" को स्कैन करने के लिए AI पर भरोसा नहीं कर सकते। आधुनिक ऑनलाइन घृणा को रोकने के लिए, हमारे सुरक्षा प्रणालियों को तर्क को पढ़ने का तरीका सीखना होगा, न कि केवल शब्दों को। उन्हें वाक्य के पीछे के तर्क को समझने की आवश्यकता है ताकि वे देख सकें कि क्या वह हमें किसी समूह से नफरत करने के लिए बहलाने की कोशिश कर रहा है, भले ही वह सुनने में कितना भी विनम्र क्यों न हो।
मुख्य बात: वर्तमान AI सुरक्षा उपकरण उन बाउंसरों की तरह हैं जो केवल लाल टोपी पहनने वाले लोगों की जाँच करते हैं। पेपर दिखाता है कि बुरे लोग अब नीले सूट पहनकर और विनम्रता से बात करके आ रहे हैं, और हमारे बाउंसर उन्हें सीधे अंदर आने दे रहे हैं। हमें ऐसे बाउंसरों की आवश्यकता है जो इरादे को पढ़ सकें, न कि केवल पहनावे को।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।