Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity
تقترح هذه الورقة خوارزمية تعلم تعزيزي ثنائي المستوى تعتمد على التدرج الفائق (hypergradient) وتخلو من مصفوفة هيسيان (Hessian-free)، تستفيد من مثالية سياسات بولتزمان لتحقيق تعقيد عينة يبلغ وتعقيد تكرار يبلغ ، وهي مستويات رائدة في مجالها، دون اشتراط شرط بولياك-لوجاستفيتش (Polyak-Lojasiewicz) على دالة الهدف في المستوى الخارجي.