Concept-SAE: A Controllable and Invertible Concept Interface for Sparse Autoencoders
Concept-SAE एक नवीन ढांचा है जो एक्टिवेशन्स को उपयोगकर्ता-निर्धारित अर्थों के साथ संरेखित ऑर्थोगोनल "कॉन्सेप्ट टोकन्स" और अवशिष्ट जानकारी के लिए "फ्री टोकन्स" में विभाजित करके स्पार्स ऑटोएनकोडर्स को एक नियंत्रणीय, प्रतिवर्ती इंटरफेस के साथ उन्नत करता है, जिससे ओपन-एंडेड फीचर डिस्कवरी को संरक्षित करते हुए विशिष्ट अवधारणाओं की उच्च-सटीक प्रोबिंग, एडिटिंग और निदान सक्षम होता है।