Mechanistic Interpretability of Antibody Language Models Using SAEs
यह शोध पत्र ऑटोरेग्रेसिव एंटीबॉडी लैंग्वेज मॉडल्स की व्याख्या करने और उन्हें नियंत्रित करने के लिए TopK और ऑर्डर्ड स्पार्स ऑटोएनकोडर (SAEs) के उपयोग की जांच करता है, जिसमें यह पाया गया है कि जबकि जैविक अवधारणाओं को मैप करने के लिए TopK SAEs बेहतर हैं, सटीक जेनेरेटिव स्टीयरिंग के लिए ऑर्डर्ड SAEs अधिक प्रभावी हैं।