Breaking the Grid: Distance-Guided Reinforcement Learning in Large Discrete Action Spaces
यह शोध पत्र डिस्टेंस-गाइडेड रिइन्फोर्समेंट लर्निंग (DGRL) प्रस्तुत करता है, जो एक नवीन एल्गोरिदम है जो बड़े डिस्क्रीट एक्शन स्पेस (10 तक एक्शन) में 'कर्स ऑफ डाइमेंशनैलिटी' पर विजय पाने के लिए सैंपल्ड डायनेमिक नेबरहुड्स और डिस्टेंस-आधारित अपडेट्स को संयोजित करके पॉलिसी ऑप्टिमाइज़ेशन को एक स्थिर रिग्रेशन टास्क में बदल देता है, जिससे अत्याधुनिक तरीकों की तुलना में महत्वपूर्ण प्रदर्शन और अभिसरण (कन्वर्जेंस) सुधार प्राप्त होता है।