Open-Weight Masked Introspection: Measuring What Language Models Can Report About Their Own Computation
تقدم هذه الورقة إطار عمل "الاستبطان المقنع مفتوح الأوزان" (OWMI) لاختبار ما إذا كانت النماذج اللغوية الرائدة يمكنها الإبلاغ بدقة عن تغيراتها الحسابية الداخلية، حيث وجدت أنه بينما تتوفر المعلومات اللازمة داخل تنشيطاتها، تفشل النماذج الحالية مفتوحة الأوزان في ترجمة هذه الحالة الداخلية إلى تقارير لفظية موثوقة، حيث لا تؤدي أفضل من مستوى الصدفة.