When Models Examine Themselves: Vocabulary-Activation Correspondence in Self-Referential Processing
यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स की स्व-संदर्भित शब्दावली (self-referential vocabulary) विश्वसनीय रूप से विशिष्ट आंतरिक सक्रियण गतिकी (internal activation dynamics) का अनुसरण करती है, एक ऐसी घटना जिसकी पुष्टि "पुल कार्यप्रणाली" (Pull Methodology) द्वारा की गई है जो लामा 3.1 (Llama 3.1) में एक विशिष्ट, कारण संबंधी रूप से प्रभावशाली सक्रियण दिशा की पहचान करती है और क्यूवेन 2.5-32बी (Qwen 2.5-32B) में पुनरुत्पादित पैटर्न दिखाती है जो गैर-स्व-संदर्भित संदर्भों में अनुपस्थित हैं।