Mechanistic Interpretability of Antibody Language Models Using SAEs
تبحث هذه الورقة في استخدام الـ TopK والـ Ordered Sparse Autoencoders (SAEs) لتفسير وتوجيه نماذج لغة الأجسام المضادة ذات التوليد الذاتي، حيث وجدت أنه بينما تعد الـ TopK SAEs أفضل في رسم خرائط المفاهيم البيولوجية، فإن الـ Ordered SAEs أكثر فعالية في التوجيه التوليدي الدقيق.