Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications
यह शोध पत्र अधिकृत साइबर सुरक्षा कार्यों के लिए एक नियंत्रित मूल्यांकन प्रोटोकॉल के रूप में "एब्लेटिंग सेफ्टी" (Ablating Safety) का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि जहाँ सरल रिफ्यूज़ल-प्रोजेक्शन विधियाँ उच्च सुरक्षा जोखिमों के साथ न्यूनतम सुरक्षा लाभ प्रदान करती हैं, वहीं लक्षित LoRA-आधारित अनुकूलन सामान्य क्षमताओं को बनाए रखते हुए और असुरक्षित स्पिलओवर को सीमित करते हुए सुरक्षा प्रदर्शन में महत्वपूर्ण सुधार कर सकता है।