ARMS: Automatic Reward Shaping for Sparse-Reward Multi-Agent Reinforcement Learning
تقترح الورقة البحثية إطار عمل ARMS، وهو إطار عمل للتعلم المعزز متعدد الوكلاء يعتمد على التعلم الذاتي، يقوم تلقائياً بتوليد إشارات مكافأة كثيفة من مكافآت متفرقة عبر ترتيب المسارات، مع ضمان الحفاظ نظرياً على توازن ناش من خلال الاستدلال بالاستجابة المثلى الشرطية، مما يؤدي إلى تحسين كفاءة أخذ العينات والاستقرار في البيئات ذات المكافآت المتفرقة.