Performance Variation in Deep Reinforcement Learning
यह शोध पत्र पारंपरिक अनिश्चितता अनुमानों की आलोचना करके और प्रदर्शन भिन्नता को बेहतर ढंग से चित्रित करने के लिए पर्सेंटाइल-आधारित उपकरणों (मिन-मैक्स आईपीआर और रन-वाइज पर्सेंटाइल हाइलाइटिंग) का प्रस्ताव देकर डीप रिइन्फोर्समेंट लर्निंग में कम रन-टू-रन मजबूती की चुनौती को संबोधित करता है, जिनका उपयोग यह प्रदर्शित करने के लिए किया जाता है कि कैसे विशिष्ट आर्किटेक्चरल विकल्प और एल्गोरिद्मिक डिज़ाइन पीपीओ (PPO), एसएसी (SAC), टीडी-एमपीसी (TD-MPC) और डीक्यूएन (DQN) वेरिएंट्स के बीच स्थिरता को अलग-अलग तरह से प्रभावित करते हैं।