F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare
تقترح الورقة البحثية F-GRPO، وهي طريقة للتعلم التعزيزي مدركة للصعوبة تعمل على التخفيف من ميل الخوارزميات القياسية القائمة على المجموعات نحو الإفراط في ملاءمة الحلول الشائعة وإهمال المسارات الصحيحة النادرة عبر تقليل وزن التحديثات عالية النجاح، مما يؤدي إلى تحسين أداء الاستدلال الرياضي بشكل كبير عبر مختلف النماذج المرجعية دون زيادة التكاليف الحسابية.