Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs
تُثبت هذه الورقة أن التعلم التعزيزي بالمكافآت القابلة للتحقق (RLVR) يُحسّن قدرة النماذج اللغوية الكبيرة على الاستنتاج من خلال تحولات توزيعية مستهدفة وعالية الندرة على مستوى الرموز (tokens)، حيث تكون نسبة ضئيلة من قرارات الرموز الحرجة هي المسؤولة عن مكاسب الأداء، ويمكن عزلها عبر تدخلات أخذ العينات المتقاطعة.