Verifier-Induced Support Reshaping in On-Policy Optimization
تكشف هذه الورقة أن التعلم المعزز القائم على السياسة ذات المكافآت القابلة للتحقق (RLVR) يمكن أن يحسن أداء المهام الفورية، بينما يتسبب دون قصد في "إعادة تشكيل الدعم الناجم عن التحقق"، حيث تضيق السياسة توزيع مخرجاتها لجعل المسارات الناجحة للأهداف المستقبلية نادرة للغاية بحيث يصعب أخذ عينات منها، مما يؤدي إلى تقويض القدرة على التدريب طويل الأمد والقدرة المشتركة.