Skip-Connected Policy Optimization for Implicit Advantage
تقدم هذه الورقة البحثية "تحسين السياسة ذو الاتصال القفزي" (SKPO)، وهو إطار عمل جديد للتعلم التعزيزي يفكك عملية الاستدلال إلى مرحلتين: مرحلة صاعدة ومرحلة هابطة مع وجود اتصال قفزي لحل مشكلات تقدير الميزة عالية التباين في بيئات المكافآت الكثيفة، مما يحقق مكاسب أداء كبيرة مقارنة بـ "تحسين السياسة النسبي للمجموعات" (GRPO) في اختبارات الاستدلال الرياضي والعام.