The Amplifying Mirror: Locating and Steering the Partisan Direction inside a Large Language Model
यह शोध पत्र यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) में पक्षपाती राजनीतिक पूर्वाग्रह कोई अस्पष्ट उभरता हुआ गुण नहीं है, बल्कि मॉडल के एक्टिवेशन स्पेस के भीतर एक सटीक, सीखने योग्य ज्यामितीय विशेषता है जिसे जनरेट किए गए टेक्स्ट को व्यवस्थित रूप से बदलने के लिए पहचाना, विघटित और कारणवश हेरफेर (causally manipulate) किया जा सकता है।