Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models
यह शोध पत्र एक नवीन व्हाइट-बॉक्स एडवरसैरियल अटैक पद्धति प्रस्तुत करता है जो मैकेनिस्टिक इंटरप्रिटेबिलिटी का लाभ उठाकर एम्बेडिंग्स को रिफ्यूज़ल (अस्वीकृति) से एक्सेप्टेंस (स्वीकृति) सबस्पेस में पहचानने और पुनरनिर्देशित करने का कार्य करती है, जिससे मौजूदा तकनीकों की तुलना में काफी कम कम्प्यूटेशनल लागत के साथ अत्याधुनिक एलएलएम (LLMs) पर उच्च जेलब्रेक सफलता दर प्राप्त होती है।