Delightful Exploration
تقدم هذه الورقة البحثية الاستكشاف الموجه بالبهجة (DE)، وهو استدلال يحسن عملية الاستكشاف عبر تفعيل إجراءات التجاوز فقط عندما يتجاوز حاصل ضرب التحسن المتوقع في المفاجأة عتبة تكلفة ديناميكية، مما يحقق أداءً فائقاً في تقليل الندم وقابلية نقل المعلمات الفائقة عبر مختلف إعدادات "بانديت" وعمليات اتخاذ القرار الماركوفية (MDP) مقارنة بالطرق القياسية مثل "تومسون سامبلينج" و"إبسيلون-جريدي".