Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training
تقدم هذه الورقة مرشح اتساق العملية (PROF)، وهو طريقة لتنقية البيانات تستفيد من الاتساق بين نماذج مكافأة العملية ونماذج مكافأة النتيجة لاختيار عينات تدريب عالية الجودة، مما يؤدي إلى تحسين دقة الإجابة النهائية وموثوقية الاستدلال مع تجنب عدم الاستقرار الناتج عن التحسين المباشر للمكافأة.