Beyond the Bellman Recursion: A Pontryagin-Guided Framework for Non-Exponential Discounting
यह शोध पत्र पोंट्रियागिन-गाइडेड डायरेक्ट पॉलिसी ऑप्टिमाइज़ेशन (PG-DPO) प्रस्तुत करता है, जो एक ऐसा वेरिएशनल ढांचा है जो गैर-एक्सपोनेंशियल डिस्काउंटिंग के तहत बेलमैन-शैली के रिकर्शन की संरचनात्मक सीमाओं को पोंट्रियागिन मैक्सिमम प्रिंसिपल को मोंटे कार्लो रोलआउट्स के साथ जोड़कर दूर करता है।