A Monosemantic Attribution Framework for Stable Interpretability in Clinical Neuroscience Transformer-Based Language Models
यह शोध पत्र एक एकीकृत व्याख्यात्मकता ढांचे (interpretability framework) को प्रस्तुत करता है जो ट्रांसफॉर्मर-आधारित भाषा मॉडलों के लिए स्थिर, इनपुट-स्तरीय महत्व स्कोर उत्पन्न करने के लिए मोनोसेमेंटिक फीचर निष्कर्षण (monosemantic feature extraction) का लाभ उठाता है, जिससे पॉलीसेमेंटिसिटी (polysemanticity) और अंतर-विधि परिवर्तनशीलता की चुनौतियों को संबोधित किया जा सके ताकि अल्जाइमर रोग के निदान में विश्वसनीय नैदानिक अनुप्रयोगों को सक्षम बनाया जा सके।