Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs
यह शोध पत्र युग्मित आंतरिक एट्रिब्यूशन ग्राफों (paired internal attribution graphs) का उपयोग करते हुए एक यांत्रिक ढांचे (mechanistic framework) को प्रस्तुत करता है ताकि यह निदान किया जा सके कि प्रतिकूल हमले (adversarial attacks) आंतरिक तर्क संरचनाओं को व्यवस्थित रूप से कैसे बदलते हैं, जिससे LLM जेलब्रेक का पता लगाया जा सके, जो मॉडल की मजबूती (robustness) में सुधार के लिए कारण संबंधी हस्तक्षेपों (causal interventions) को सक्षम बनाता है।