Learning the Supports for Categorical Critic in Reinforcement Learning
यह शोध पत्र एक नवीन एक्टर-क्रिटिक सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) दृष्टिकोण प्रस्तावित करता है जो गॉसियन हिस्टोग्राम लॉस के लिए सपोर्ट बाउंड्स को गतिशील रूप से सीखता है, जिससे पूर्व-निर्धारित अंतराल की आवश्यकता समाप्त हो जाती है और साथ ही एक कड़ा सैद्धांतिक त्रुटि बाउंड प्रदान करने के साथ-साथ निरंतर नियंत्रण कार्यों पर मौजूदा विधियों के तुलनीय या बेहतर प्रदर्शन प्राप्त होता है।