GRPO is Secretly a Process Reward Model
تثبت هذه الورقة نظرياً أن تحسين السياسة النسبي للمجموعات (GRPO) مع نموذج مكافأة المخرجات يكافئ نموذج مكافأة العملية، وتحدد خللاً في تعامله مع الخطوات غير المتوازنة، وتقترح تعديلاً بسيطاً (-GRPO) يحسن أداء الاستدلال وكفاءة التدريب بشكل كبير دون الحاجة إلى نماذج مكافأة عملية صريحة.