RL Fine-Tuning Heals OOD Forgetting in SFT
تتحدى هذه الورقة المفهوم القائل بأن "الضبط الدقيق الخاضع للإشراف (SFT) يحفظ، بينما التعلم المعزز (RL) يعمم" من خلال إثبات، عبر تحليلات نقطة التحقق والتحليل الطيفي، أن الضبط الدقيق الخاضع للإشراف غالبًا ما يسبب نسيانًا للبيانات خارج التوزيع، وهو ما يتم استعادته لاحقًا بواسطة التعلم المعزز، وهي عملية استعادة مرتبطة بدوران المتجهات المنفردة وليس بتغيرات في القيم المنفردة.