Sample-Efficient Distributionally Robust Multi-Agent Reinforcement Learning via Online Interaction
تقدم هذه الورقة خوارزمية "تكرار قيمة ناش المتفائل القوي متعدد اللاعبين" (MORNAVI)، والتي تبتكر التعلم عبر الإنترنت للألعاب الماركوفية المتينة توزيعياً من خلال تمكين الوكلاء من تعلم السياسات المتينة المثلى بكفاءة مباشرة من التفاعلات البيئية مع ندم منخفض مثبت، مما يلغي الحاجة إلى أجهزة محاكاة أو مجموعات بيانات ضخمة غير متصلة بالإنترنت.