Bilevel Optimization over Saddle Points of Zero-Sum Markov Games
تقترح هذه الورقة طريقة PANDA، وهي طريقة تدرج سياسة من الدرجة الأولى تعتمد على الجزاء، تحل بكفاءة مشكلات الأمثلة ثنائية المستوى حيث يكون المستوى الأدنى عبارة عن لعبة ماركوف صفرية المجموع، محققةً التقارب إلى النقاط الثابتة بتعقيد عينة أمثل دون الحاجة إلى معلومات من الدرجة الثانية أو افتراضات التحدب.