Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration
यह शोध पत्र प्रदर्शित करता है कि "एब्लिटरेशन" (abliteration), जो कि रिफ्यूज़ल दिशाओं को ऑर्थोगोनली प्रोजेक्ट करने वाली एक लो-रैंक वेट एडिटिंग तकनीक है, सुरक्षा-संरेखित कोड एलएलएम (LLM) की असुरक्षित कोड उत्पन्न करने से मना करने की प्रवृत्ति को उनकी वास्तविक पीढ़ी क्षमताओं से प्रभावी रूप से अलग कर सकता है, जिससे सिंटैक्टिक वैधता से समझौता किए बिना भेद्यता पहचान अनुसंधान के लिए लेबल किए गए असुरक्षित कोड का स्केलेबल उत्पादन सक्षम हो जाता है।