From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks
यह शोध पत्र यह प्रकट करता है कि बड़े भाषा मॉडल अक्सर वर्ण गणना (character counting) के कार्यों में आंतरिक प्रतिनिधित्व की कमी के कारण नहीं, बल्कि इसलिए विफल होते हैं क्योंकि बाद की परतों में विशिष्ट नकारात्मक सर्किट सही संकेतों के बजाय गलत, उच्च-संभावना वाले आउटपुट को सक्रिय रूप से दबा देते हैं।