Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models
यह शोध पत्र प्रकट करता है कि जेलब्रेक हमले सभी सुरक्षा विशेषताओं को समाप्त करके नहीं, बल्कि प्रारंभिक-परत के 'एडवर्सैरियली कॉम्प्रोमाइज्ड हेड्स' (Adversarially Compromised Heads) को चुनिंदा रूप से दबाकर और मध्य-परत के 'सेफ्टी-अलाइन्ड हेड्स' (Safety-Aligned Heads) को मजबूती से सक्रिय रखकर एलएलएम (LLM) सुरक्षा को दरकिनार करते हैं, जिसे "रोबस्ट हार्मफुल फीचर्स" (Robust Harmful Features) नामक घटना कहा गया है जो हमलों की यांत्रिक समझ और प्रभावी पहचान दोनों को सक्षम बनाती है।