Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO
تحدد هذه الورقة وتُعالج انحياز التجميع في التعلم المعزز من نمط GRPO باستخدام المكافآت القابلة للتحقق عبر اقتراح "التجميع المتوازن"، وهي طريقة تقوم بمتوسط تدرجات مستوى الرمز (token-level gradients) للاستجابات الإيجابية والسلبية بشكل منفصل قبل إعادة دمجها، مما يؤدي إلى تحسين استقرار التدريب والأداء عبر اختبارات الاستدلال والبرمجة.