Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning
تقترح هذه الورقة نهجاً تكيفياً جديداً للتعلم التعزيزي من النوع "من أوفلاين إلى أونلاين" (Offline-to-Online) يقوم باختيار وضبط السياسات المرشحة بكفاءة في ظل ميزانيات تفاعل محدودة، وذلك عبر الجمع بين تقديرات الأداء غير المتصل (offline) واستراتيجية الحد الأعلى للثقة للتغلب على عدم موثوقية التقييم خارج السياسة وعدم عملية الاختبار المباشر الشامل.