Safety Is Not Universal: The Selective Safety Trap in LLM Alignment
यह शोध पत्र लार्ज लैंग्वेज मॉडल्स में "सेलेक्टिव सेफ्टी ट्रैप" (चयनात्मक सुरक्षा जाल) को उजागर करता है, जहाँ सुरक्षा संरेखण एक जनसांख्यिकीय पदानुक्रम बनाता है जो अल्पप्रतिनिधित्व वाले समूहों को असुरक्षित छोड़ देता है, और सभी आबादी के लिए न्यायसंगत, हस्तांतरणीय सुरक्षा प्राप्त करने हेतु एक नए द्विभाषी बेंचमार्क (MiJaBench) और लक्षित अनुकूलन पद्धति का प्रस्ताव करता है।