MDP Planning as Policy Inference
यह शोध पत्र एपिसोडिक मार्कोव निर्णय प्रक्रिया नियोजन (episodic Markov decision process planning) के लिए नीतियों पर बेयसियन अनुमान (Bayesian inference) के रूप में एक वैचारिक ढांचे का प्रस्ताव करता है, जहाँ नीति एक गुप्त चर (latent variable) के रूप में कार्य करती है और अपेक्षित प्रतिफल (expected return) पश्च वितरण (posterior) को परिभाषित करता है, जो प्रक्षेपवक्र-केंद्रित (trajectory-centric) या एंट्रॉपी-नियमित दृष्टिकोणों के एक विशिष्ट विकल्प के रूप में विभिन्न वातावरणों में वेरिएशनल सीक्वेंशियल मोंटे कार्लो विधियों के माध्यम से अपनी प्रभावकारिता प्रदर्शित करता है।