DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
تقترح الورقة البحثية طريقة "تحسين الميزة التكيفي مع التباين الديناميكي" (DVAO)، وهي طريقة مبتكرة تعمل على ضبط أوزان دمج المكافآت المتعددة ديناميكياً بناءً على التباين التجريبي للتغلب على عدم الاستقرار في التدريب والقيود الثابتة لعملية التدرج القياسي المعيارية في "تحسين السياسة النسبي للمجموعات" (GRPO)، مما يحقق أداءً واستقراراً فائقين في محاذاة النماذج اللغوية الكبيرة مع أهداف متعددة.