PAC-Bayesian Reinforcement Learning Trains Generalizable Policies
यह शोध पत्र सुदृढीकरण लर्निंग (reinforcement learning) के लिए एक नवीन PAC-Bayesian सामान्यीकरण बाउंड (generalization bound) प्रस्तुत करता है जो मिक्सिंग टाइम (mixing time) के माध्यम से मार्कोव निर्भरताओं (Markov dependencies) को ध्यान में रखता है, और PB-SAC का प्रस्ताव करता है, जो निरंतर नियंत्रण कार्यों (continuous control tasks) में प्रतिस्पर्धी प्रदर्शन बनाए रखते हुए गैर-रिक्त सामान्यीकरण प्रमाण (non-vacuous generalization certificates) प्रदान करने के लिए इस बाउंड को अनुकूलित करता है।