Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning
تقدم هذه الورقة البحثية "تحسين سياسة المتوسط القدرتي التكيفي" (APMPO)، وهو إطار عمل جديد للتعلم التعزيزي يعزز قدرات الاستنتاج في النماذج اللغوية الكبيرة من خلال هدف متوسط قدرتي معمم وتقليم تكيفي قائم على التغذية الراجعة، محققاً أداءً فائقاً على النماذج المرجعية المتطورة عبر مهام استنتاجية متعددة.