Whether, Not Which: Mechanistic Interpretability Reveals Dissociable Affect Reception and Emotion Categorization in LLMs
यह अध्ययन स्पष्ट भावनात्मक कीवर्ड रहित क्लिनिकल विनेट्स (clinical vignettes) का उपयोग यह प्रदर्शित करने के लिए करता है कि लार्ज लैंग्वेज मॉडल्स में एक पृथक दोहरी प्रक्रिया (dissociable dual mechanism) होती है जहाँ प्रारंभिक-परत सर्किट कीवर्ड्स के बावजूद विश्वसनीय रूप से सामान्य भावनात्मक महत्व (अफेक्ट रिसेप्शन) का पता लगाते हैं, जबकि विशिष्ट भावना वर्गीकरण आंशिक रूप से लेक्सिकल संकेतों (lexical cues) पर निर्भर रहता है।