Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations
यह शोध पत्र एक मानव-आधारित मूल्यांकन ढांचे को प्रस्तुत करता है जिसमें फुली-बाइनरी मैचिंग पर्स्यूट (FBMP) एल्गोरिदम और टार्गेटेड एट्रिब्यूट पर्टर्बेशन अलाइनमेंट स्कोर (TAPAScore) के साथ-साथ सिंथेटिक बेंचमार्क (synCUB और synCOCO) शामिल हैं, जो स्पार्स ऑटोएनकोडर्स के सिमेंटिक अलाइनमेंट और व्याख्यात्मकता को कड़ाई से मापने के लिए उपयोग किए जाते हैं, और यह प्रकट करता है कि अवधारणा निष्कर्षण (concept extraction) के लिए मध्यम डिक्शनरी आकार इष्टतम संतुलन प्रदान करते हैं।