EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization
यह शोध पत्र EBPO का प्रस्ताव करता है, जो एक नवीन ढांचा है जो लार्ज लैंग्वेज मॉडल्स के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन को स्थिर करने हेतु एम्पेरिकल बेयस श्रिंकेज (Empirical Bayes shrinkage) का उपयोग करके स्थानीय बेसलाइन्स को वैश्विक सांख्यिकी के साथ नियमित करता है, जिससे अनुमानित वेरिएंस कम होता है, वैनिशिंग ग्रेडिएंट्स को रोकता है, और विविध रीजनिंग बेंचमार्क पर मौजूदा विधियों से बेहतर प्रदर्शन करता है।