EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget
यह शोध पत्र एक्सप्लोरेशन-एन्हांस्ड पॉलिसी ऑप्टिमाइज़ेशन (EEPO) को प्रस्तुत करता है, जो बड़े भाषा मॉडलों (LLMs) के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है, जो स्व-सुदृढ़ व्यवहार संबंधी लूपों को बाधित करने और अन्वेषण (exploration) को बढ़ाने के लिए एक "सैंपल-देन-फॉरगेट" तंत्र का उपयोग करके एंट्रॉपी पतन (entropy collapse) को कम करता है और तर्क प्रदर्शन में सुधार करता है।