Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content
यह शोध पत्र विषाक्तता वर्गीकरणकर्ताओं (toxicity classifiers) के लिए एक नवीन सक्रिय रक्षा रणनीति का प्रस्ताव करता है जो एलएलएम-जनित सामग्री (LLM-generated content) के संदर्भ में प्रतिकूल हमलों (adversarial attacks) के विरुद्ध मजबूती में सुधार करने और विविध जनसांख्यिकीय समूहों में निष्पक्षता अंतराल को संबोधित करने के लिए कमजोर तंत्रिका सर्किट घटकों (neural circuit components) की पहचान करने और उन्हें दबाने हेतु यांत्रिक व्याख्यात्मकता (mechanistic interpretability) का लाभ उठाता है।