LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training
تقدم هذه الورقة LaRA، وهو إطار عمل لتحليل التمثيلات على مستوى الطبقات يكتشف تلوث البيانات في النماذج اللغوية الكبيرة التي خضعت للضبط اللاحق باستخدام التعلم المعزز، وذلك من خلال تحديد الانحرافات الهندسية مثل حساسية الاضطراب المتزايدة، والانهيار الاتجاهي، والصلابة المحلية، متفوقاً بذلك على طرق الكشف الحالية القائمة على مستوى المخرجات.