Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality
यह शोध पत्र एक पुनरावृत्ति दृष्टिकोण (iterative approach) प्रस्तावित करता है जो अज्ञात MDP मापदंडों को PAC लर्निंग शर्तों को संतुष्ट करने के लिए परिष्कृत करता है, जिससे एसिम्प्टोटिक अनुकूलता (asymptotic optimality) की गारंटी मिलती है और पहुंच योग्यता विशिष्टताओं (reachability specifications) के लिए सुदृढीकरण शिक्षण (reinforcement learning) की अभिसरण गतिशीलता (convergence dynamics) में गहरी सैद्धांतिक अंतर्दृष्टि प्रदान होती है।