Gradient Extrapolation-Based Policy Optimization
यह शोध पत्र ग्रेडिएंट एक्सट्रैपोलेशन-आधारित पॉलिसी ऑप्टिमाइज़ेशन (GXPO) का प्रस्ताव करता है, जो GRPO-शैली के रीजनिंग RL के लिए एक प्लग-कम्पैटिबल विधि है, जो बिना किसी नए रोलआउट की आवश्यकता के, केवल तीन बैकवर्ड पास का उपयोग करके महंगे मल्टी-स्टेप लुकअहेड्स का अनुमान लगाता है ताकि pass@1 प्रदर्शन और प्रशिक्षण दक्षता में महत्वपूर्ण सुधार किया जा सके।