Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
تقدم هذه الورقة البحثية SPRO، وهو إطار عمل ذاتي التوجيه لتعلم التعزيز العملياتي يلغي الحاجة إلى نماذج مكافآت خارجية من خلال اشتقاق مكافآت عملياتية جوهرية وإعادة تعريف تقدير الميزة خطوة بخطوة، مما يحقق كفاءة ودقة واستقراراً فائقاً في التدريب دون أعباء حسابية إضافية مقارنة بالطرق القياسية الخاضعة للإشراف على النتائج.