Natural Policy Gradient as Doubly Smoothed Policy Iteration: A Bellman-Operator Framework
यह शोध पत्र डबली स्मूथड पॉलिसी इटरेशन (DSPI) फ्रेमवर्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि नेचुरल पॉलिसी ग्रेडिएंट, पॉलिसी इटरेशन का एक सटीक स्मूथड और औसत रूप है, जिससे बिना किसी MDP संशोधनों या एडेप्टिव स्टेपसाइज़ की आवश्यकता के, अनरेगुलराइज्ड मामलों के लिए इसके डिस्ट्रीब्यूशन-फ्री ग्लोबल ज्योमेट्रिक कन्वर्जेंस और फाइनाइट टर्मिनेशन को सिद्ध किया जा सके।