Mechanistic Interpretability with Sparse Autoencoder Neural Operators
تقدم هذه الورقة مشغلات عصبية ذات ترميز تلقائي متناثر (SAE-NOs)، وهي إطار عمل مبتكر يوسع المشفرات التلقائية المتناثرة التقليدية عبر تمثيل المفاهيم كدوال مهيكلة بدلاً من تنشيطات قياسية، مما يتيح نمذجة تعبير المفاهيم عبر نطاقات المدخلات، وتحقيق تعميم فائق عبر الدقات المختلفة، وتسريع عملية التحسين من خلال تقنية رفع مبتكرة.