On the Benefits of Free Exploration for Regret Minimization in Multi-Armed Bandits
تقدم هذه الورقة إطاراً جديداً لمسألة "المتعدد الأذرع العشوائية" (stochastic multi-armed bandit) حيث يستخدم الوكيل ميزانية استكشاف حر لوغاريتمية قبل تراكم الندم، وتقترح خوارزمية UFE-KLUCB-H وتضع حدوداً وثيقة تعتمد على الحالة تثبت تقليلاً كبيراً في الندم مقارنة بالطرق التقليدية.