← नवीनतम पेपर
💬 NLP

Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content

यह शोध पत्र विषाक्तता वर्गीकरणकर्ताओं (toxicity classifiers) के लिए एक नवीन सक्रिय रक्षा रणनीति का प्रस्ताव करता है जो एलएलएम-जनित सामग्री (LLM-generated content) के संदर्भ में प्रतिकूल हमलों (adversarial attacks) के विरुद्ध मजबूती में सुधार करने और विविध जनसांख्यिकीय समूहों में निष्पक्षता अंतराल को संबोधित करने के लिए कमजोर तंत्रिका सर्किट घटकों (neural circuit components) की पहचान करने और उन्हें दबाने हेतु यांत्रिक व्याख्यात्मकता (mechanistic interpretability) का लाभ उठाता है।

मूल लेखक: Shaz Furniturewala, Arkaitz Zubiaga

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shaz Furniturewala, Arkaitz Zubiaga

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक क्लब के दरवाजे पर एक बहुत ही समझदार सुरक्षा गार्ड है। इस गार्ड का काम "विषाक्त" (toxic) लोगों (जो बदतमीजी, नफरत या दुर्व्यवहार कर रहे हों) को पहचानना है और उन्हें तभी अंदर जाने देना है जब वे हानिरहित हों।

लंबे समय तक, हमें लगा कि ये गार्ड काफी अच्छे थे। लेकिन यह शोध पत्र एक डरावना रहस्य उजागर करता है: इन गार्ड्स में एक बहुत ही छोटा, विशिष्ट अंध बिंदु (blind spot) है। यदि कोई बुरा व्यक्ति जानता है कि वह अंध बिंदु कहाँ है, तो वह एक गुप्त कोड फुसफुसा सकता है जिससे गार्ड विषाक्तता को पूरी तरह से अनदेखा कर देता है। यह बिल्कुल वैसा ही है जैसे गार्ड अचानक ध्वनि की एक विशिष्ट आवृत्ति (frequency) के प्रति बहरा हो जाए।

शोधकर्ताओं ने केवल एक मजबूत गार्ड बनाने की कोशिश नहीं की (जो कि सामान्य तरीका है)। इसके बजाय, उन्होंने मैकेनिस्टिक इंटरप्रिटेबिलिटी (mechanistic interpretability) नामक एक विशेष "एक्स-रे विजन" टूल का उपयोग किया ताकि वे गार्ड के मस्तिष्क के अंदर देख सकें कि कौन से छोटे गियर खराब हुए हैं।

यहाँ जो उन्होंने पाया, उसकी सरल व्याख्या दी गई है:

1. मस्तिष्क में "जादुई स्विच"

इन AI गार्डों (जिन्हें BERT, RoBERTa और Llama Guard जैसे मॉडल कहा जाता है) के अंदर, हजारों छोटे कार्यकर्ता होते हैं जिन्हें "अटेंशन हेड्स" (attention heads) कहा जाता है। इन्हें छोटे न्यूरॉन्स या गियर्स के रूप में सोचें।

शोधकर्ताओं ने पाया कि कुछ प्रकार की विषाक्त सामग्री (विशेष रूप से विकिपीडिया कमेंट्स में पाई जाने वाली सामग्री, जिसे Jigsaw कहा जाता है) के लिए, पूरा सिस्टम सारा काम करने के लिए एक ही सिंगल गियर पर निर्भर करता है।

  • समस्या: हमलावरों ने इस एक विशिष्ट गियर को जाम करने का तरीका ढूंढ लिया। जब यह जाम होता है, तो पूरा गार्ड विफल हो जाता है, और विषाक्त सामग्री अंदर पहुँच जाती है।
  • समाधान: शोधकर्ताओं ने एक अजीब समाधान आजमाया: उन्होंने बस उस एक खराब गियर को बंद कर दिया।
  • परिणाम: आश्चर्यजनक रूप से, उस गियर को बंद करने से गार्ड हमलावरों के खिलाफ बहुत अधिक स्मार्ट हो गया! गार्ड गुप्त कोडों से छलकने से रुक गया। वास्तव में, एक मॉडल के लिए, केवल एक गियर को बंद करने से बुरे लोगों को पकड़ने की गार्ड की क्षमता में 70% तक सुधार हुआ, जबकि वास्तविक बुरे लोगों को पकड़ने की क्षमता को बहुत कम नुकसान पहुँचा।

2. सभी गार्ड एक जैसे नहीं बने होते

शोधकर्ताओं ने दो अलग-अलग प्रकार के "क्लबों" (डेटासेट) का परीक्षण किया:

  • क्लब Jigsaw (मानव-लिखित कमेंट्स): इस क्लब में एकल विफलता बिंदु (single point of failure) है। यह एक किले जैसा है जिसमें एक मुख्य द्वार है। यदि आप उस द्वार को अवरुद्ध कर देते हैं, तो पूरी रक्षा ढह जाती है। शोधकर्ताओं ने पाया कि इस क्लब के लिए, खराब गियर को बंद करना सबसे अच्छा बचाव था।
  • क्लब ToxiGen (AI-जनित घृणा भाषण): यह क्लब अलग है। इसमें कई छोटे दरवाजों का एक विकेंद्रीकृत नेटवर्क (distributed network) है; यह केवल एक गेट पर निर्भर नहीं है। यहाँ कोई एक "जादुई स्विच" नहीं है।
    • परिणाम: यहाँ एक गियर को बंद करने से ज्यादा मदद नहीं मिली। इसके बजाय, इस क्लब के लिए सबसे अच्छा बचाव यह था कि गार्ड को बुरी चीजों के अधिक उदाहरणों के साथ प्रशिक्षित किया जाए (डेटा ऑग्मेंटेशन)। यह गार्ड को विभिन्न प्रकार के भेषों को पहचानने के लिए सिखाने जैसा है, न कि केवल एक टूटे हुए गियर को ठीक करने जैसा।

3. "किसे चोट पहुँचती है?" परीक्षण

शोधकर्ताओं ने यह भी पूछा: क्या यह टूटा हुआ गियर सभी को समान रूप से प्रभावित करता है?
उन्होंने देखा कि गार्ड ने विभिन्न समूहों के लोगों (जाति, धर्म, विकलांगता आदि के आधार पर) के साथ कैसा व्यवहार किया।

  • निष्कर्ष: खराब गियर ने सभी को समान रूप से प्रभावित नहीं किया। जब गार्ड "हैक" किया गया था, तो कुछ समूह दूसरों की तुलना में बहुत अधिक असुरक्षित थे।
  • उपमा: कल्पना कीजिए कि गार्ड का एक विशिष्ट अंध बिंदु है जो केवल लाल टोपी पहनने वाले लोगों को प्रभावित करता है। यदि आप अंध बिंदु को ठीक कर देते हैं, तो अचानक लाल टोपी वाले लोगों के साथ निष्पक्ष व्यवहार होता है, जबकि नीली टोपी वाले लोग पहले से ही ठीक थे। शोध पत्र ने पाया कि विकलांगता समूहों और धार्मिक समूहों के अनुभव मानव-लिखित या AI-लिखित टेक्स्ट के आधार पर बहुत अलग थे। यह साबित करता है कि अन्याय रैंडम नहीं है; यह मशीन के विशिष्ट गियर्स में बना हुआ है।

4. "Llama" दिग्गज

उन्होंने Llama Guard 2 नामक एक बहुत बड़े, नए गार्ड का भी परीक्षण किया।

  • आश्चर्य: छोटे गार्डों में, "खराब गियर" मस्तिष्क के बीच में था। इस विशाल गार्ड में, "खराब गियर" बिल्कुल मुख्य दरवाजे पर (पहले लेयर पर) था।
  • सबक: जैसे-जैसे AI मॉडल बड़े और गहरे होते जाते हैं, उनके सबसे कमजोर होने का स्थान प्रवेश द्वार के करीब आता जाता है।

मुख्य निष्कर्ष

यह पेपर तर्क देता है कि हमें केवल इन मॉडलों को "मजबूत" बनाने के लिए अधिक पैसा लगाने के बजाय (जो कि अधिक गार्ड रखने जैसा है), मशीन के भीतर विशिष्ट, टूटे हुए गियर्स को खोजने के लिए एक्स-रे विजन का उपयोग करना चाहिए।

  • यदि मशीन में एक टूटा हुआ गियर है, तो बस उसे बंद कर दें
  • यदि मशीन में कई छोटे कमजोर बिंदु हैं, तो इसे अधिक उदाहरण सिखाएं
  • और हमेशा जांचें कि क्या टूटा हुआ गियर कुछ विशिष्ट समूहों को दूसरों की तुलना में अधिक नुकसान पहुँचा रहा है।

यह समझने से कि मशीन कैसे सोचती है, न कि इसे केवल एक ब्लैक बॉक्स की तरह देखने से, हम इसे अधिक सुरक्षित, निष्पक्ष और भरोसेमंद बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →