Future-KL Regularized GRPO: Process-Level Credit Assignment from -Divergence Regularization
تقدم هذه الورقة البحثية طريقة "تحسين السياسة المنظمة بـ KL المستقبلية" (FRPO)، وهي طريقة خالية من الناقد تعمل على تصحيح تنظيم KL على مستوى الرمز (token) في طريقة GRPO عبر دمج عائد "العودة إلى ما تبقى" (return-to-go) المنظم مستقبلياً وعلاقياً والمستمد من تباعد ، مما يؤدي إلى تحسين أداء الاستدلال الرياضي مع الحفاظ على اعتلاج (entropy) أعلى وانزياح سياسة أقل.