Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with -step Policy Gradients
यह शोध पत्र एक सामान्यीकृत -स्टेप पॉलिसी ग्रेडिएंट पद्धति प्रस्तावित करता है जो -स्टेप विंडो पर यादृच्छिकता (randomness) को जोड़कर प्रतिबंधित पॉलिसी वर्गों में निहित अल्पदर्शी स्थानीय इष्टतमों (myopic local optima) पर विजय प्राप्त करता है, जो वितरण बेमेल कारकों (distribution mismatch factors) पर निर्भर किए बिना निकट-इष्टतम समाधानों में अभिसरण की सैद्धांतिक गारंटी देता है।