On-line Learning in Tree MDPs by Treating Policies as Bandit Arms
تقترح هذه الورقة إطار عمل للتعلم عبر الإنترنت لمشكلات ماركوف لاتخاذ القرار الشجرية، والتي تعامل السياسات كأذرع متعددة الأذرع، متجاوزةً بذلك فضاء السياسات الأسي عبر تصميم حدود ثقة مشتركة البيانات لتحقيق حسابات في زمن حدودي وتحسين تعقيد العينات في كل من إعدادات التعلم ضمن حدود الاحتمالية (PAC) وتقليل الندم.