Multi-Armed Bandits With Machine Learning-Generated Surrogate Rewards
تقدم هذه الورقة خوارزمية الحد العلوي للثقة المدعومة بالتعلم الآلي (MLA-UCB)، والتي تستفيد من مكافآت بديلة منحازة يتم إنشاؤها بواسطة نماذج تعلم آلي مدربة مسبقاً من بيانات مساعدة غير متصلة بالإنترنت لتقليل الندم التراكمي بشكل كبير وتحقيق الأمثلية التقاربية في مشكلات المندوب متعدد الأذرع دون الحاجة إلى معرفة مسبقة بالتباين المشترك بين المكافآت البديلة والمكافآت الحقيقية.