Augmented Lagrangian Method for Last-Iterate Convergence for Constrained MDPs
यह शोध पत्र एक इनएक्सैक्ट ऑगमेंटेड लैग्रेंजियन विधि पर आधारित एक सामान्य ढांचे का प्रस्ताव करता है जो टैबुलर, लॉग-लीनियर और जटिल गैर-रेखीय नीति सेटिंग्स में बाधाओं वाले मार्कोव निर्णय प्रक्रियाओं के लिए सिद्ध वैश्विक अंतिम-इटरेशन अभिसरण (global last-iterate convergence) प्राप्त करता है, जो मौजूदा मिश्रण-नीति दृष्टिकोणों की व्यावहारिक सीमाओं को संबोधित करता है।