Vulnerable Agent Identification in Large-Scale Multi-Agent Reinforcement Learning
تتناول هذه الورقة مشكلة تحديد الوكيل الضعيف في التعلم المعزز متعدد الوكلاء واسع النطاق عبر اقتراح إطار عمل للتحكم في المجال المتوسط اللامركزي التنافسي الهرمي، والذي يفصل عملية اختيار الوكيل ذات التعقيد الحسابي العالي (NP-hard) عن تعلم السياسة التنافسية عبر تحويل "فينشل-روكافيلر"، مما يتيح تحديداً فعالاً ومثبتاً من حيث المثالية للوكلاء الذين تسبب أعطالهم أسوأ تدهور في أداء النظام.