How LLMs Are Persuaded: A Few Attention Heads, Rerouted
यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स में अनुनय-प्रेरित तथ्यात्मक त्रुटियाँ एक संक्षिप्त, निगरानी योग्य सर्किट के कारण होती हैं जहाँ उथले अटेंशन हेड्स (shallow attention heads) प्रेरक कीवर्ड्स का पता लगाकर एक विशिष्ट एविडेंस-रूटिंग फीचर को पुनर्निर्देशित करते हैं, जिससे निर्णय लेने वाले हेड्स (decision heads) को एक निम्न-आयामी लेटेंट स्पेस में सही उत्तर से हटकर अनुनय-लक्ष्य वर्टेक्स (persuasion-target vertex) की ओर जाने के लिए मजबूर किया जाता है।