Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions
تحدد هذه الورقة البحثية التعقيد العيني الأمثل (minimax-optimal sample complexity) لتعلم السياسات ذات الكفاءة في عمليات ماركوف لاتخاذ القرار ذات المكافأة المتوسطة والمتينة توزيعياً، كاشفةً عن حد تعقيد يعتمد على النظام ينتقل من السلوك الاسمي إلى السلوك المتين بناءً على مقياس الاضطراب ، وتحقق هذه المعدلات من خلال إجراءات اختزال "plug-in" مبتكرة تعتمد على المدى (span-informed) وغير معتمدة عليه (span-agnostic).