Composing Reinforcement Learning Policies, with Formal Guarantees
تقترح هذه الورقة إطار عمل مبتكر يجمع بين التركيب التفاعلي للتخطيط عالي المستوى ونهج التعلم المعزز لتدريب السياسة منخفضة المستوى على البنى الكامنة لتكوين وحدات تحكم للبيئات المعقدة ذات المستويين، مع توفير ضمانات أداء رسمية دون الحاجة إلى تقطير النموذج.