Unifying Entropy Regularization in Optimal Control: From and Back to Classical Objectives via Iterated Soft Policies and Path Integral Solutions
यह शोध पत्र इष्टतम नियंत्रण (optimal control) के लिए एक एकीकृत KL-नियमित ढांचे (KL-regularized framework) को प्रस्तुत करता है जो सॉफ्ट-पॉलिसी सरोगेट्स (soft-policy surrogates) के माध्यम से शास्त्रीय और जोखिम-संवेदनशील उद्देश्यों का सामान्यीकरण करता है, जिन्हें मूल लक्ष्यों को पुनः प्राप्त करने के लिए पुनरावृत्त किया जा सकता है और एक सिंक्रोनाइज़्ड मामले में, रैखिक बेलमैन ऑपरेटरों और पाथ-इंटिग्रल समाधानों को उत्पन्न कर सकता है।