Calibrated Partial Resets: Preventing Policy Collapse in Continual Reinforcement Learning
यह शोधपत्र कैलिब्रेटेड पार्शियल रीसेट्स (CPR) को प्रस्तुत करता है, जो एक ऐसा ऑप्टिमाइज़र है जो कम उपयोगिता वाले न्यूरॉन्स को आवधिक और चयनात्मक रूप से उनके इनिशियलाइज़ेशन की ओर खींचकर निरंतर सुदृढीकरण शिक्षण (continual reinforcement learning) में पॉलिसी कोलैप्स को रोकता है, जिससे शिखर प्रदर्शन से समझौता किए बिना प्लास्टिसिटी बनाए रखी जा सकती है।