On Advantage Estimates for Max@K Policy Gradients
यह शोध पत्र MaxPO प्रस्तुत करता है, जो सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) में max@K उद्देश्यों को अनुकूलित करने के लिए एक नई पॉलिसी-ग्रेडिएंट विधि है, जो केंद्रित लाभ (centered advantages) सुनिश्चित करने, ग्रेडिएंट वेरिएंस को कम करने और अधिक प्रभावी LLM पोस्ट-ट्रेनिंग के लिए मौजूदा एस्टिमेटर्स को एकीकृत करने के लिए एक नवीन 'लीव-टू-आउट' (Leave-Two-Out) बेसलाइन का उपयोग करता है।