reward-lens: A Mechanistic Interpretability Library for Reward Models
تقدم الورقة البحثية "reward-lens"، وهي مكتبة مفتوحة المصدر تعمل على تطويع أدوات التفسير الآلي لنماذج المكافأة من خلال الاستفادة من متجه أوزان رأس المكافأة كمحور مركزي، كاشفةً أن طرق الإسناد الخطي تفشل في التنبؤ بتأثيرات الرقعة السببية (causal patching) ومن ثم تحفيز إطار عمل يعامل هذا التباين كخاصية جوهرية وليس كخطأ برمي.