Continuous-time Risk-sensitive Reinforcement Learning via Quadratic Variation Penalty
यह शोधपत्र निरंतर-समय जोखिम-संवेदनशील सुदृढीकरण शिक्षण (रिइन्फोर्समेंट लर्निंग) के लिए एक मार्टिंगेल-आधारित ढांचे को स्थापित करता है जो मूल्य परिवर्तनशीलता को पकड़ने के लिए एक द्विघात विचरण दंड (क्वाड्रेटिक वेरिएशन पेनल्टी) को शामिल करता है, जिससे मौजूदा एल्गोरिदम का अनुकूलन सक्षम होता है और मर्टन की निवेश समस्या के लिए अभिसरण (कन्वर्जेंस) सिद्ध होता है, साथ ही रैखिक-द्विघात नियंत्रण में बेहतर परिमित-नमूना प्रदर्शन प्रदर्शित करता है।