Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
تقترح الورقة البحثية خوارزمية MT-GRPO، وهي خوارزمية مبتكرة تقوم بتكييف أوزان المهام ديناميكيًا وتستخدم عينة حافظة للنسبة للتغلب على عدم التوازن في التحسين في التعلم المعزز متعدد المهام، مما يؤدي إلى تحسين أداء أسوأ المهام وكفاءة التدريب بشكل كبير مقارنة بخوارزميات GRPO وDAPO القياسية.