Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients
यह शोध पत्र हाइब्रिड पॉलिसी ऑप्टिमाइज़ेशन (HPO) का प्रस्ताव करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो हाइब्रिड डिस्क्रीट-कंटीन्यूअस एक्शन स्पेस में निष्पक्ष और कुशल प्रशिक्षण सक्षम करने के लिए पाथवाइज (pathwise) और स्कोर-फंक्शन ग्रेडिएंट्स को जोड़ती है, जो उच्च-आयामी नियंत्रण और इन्वेंट्री समस्याओं में PPO जैसे मानक दृष्टिकोणों से काफी बेहतर प्रदर्शन करती है।