Adaptive Scaling of Policy Constraints for Offline Reinforcement Learning
تقترح الورقة البحثية "التحجيم التكيفي لقيود السياسة" (ASPC)، وهو إطار عمل قابل للاشتقاق من الدرجة الثانية يوازن ديناميكيًا بين التعلم التعزيزي واستنساخ السلوك للقضاء على الحاجة إلى ضبط المعلمات الفائقة لكل مجموعة بيانات، محققًا أداءً رائدًا عبر 39 مجموعة بيانات مع حد أدنى من العبء الحسابي.