Revisiting Mixture Policies in Entropy-Regularized Actor-Critic
यह शोध पत्र मिश्रण नीतियों (mixture policies) में मानक लाइकलीहुड-रेश्यो विधियों की उच्च विचरण (high variance) की समस्या को दूर करने के लिए एक मार्जिनलाइज्ड रीपैरामीट्राइजेशन (MRP) एस्टिमेटर का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण मिश्रण नीतियों को निरंतर एक्शन सुदृढीकरण लर्निंग (continuous action reinforcement learning) कार्यों में गॉसियन नीतियों के प्रदर्शन के बराबर या उससे बेहतर बनाने में सक्षम बनाता है।