LamPO: A Lambda Style Policy Optimization for Reasoning Language Models
LoMP0 एक नवीन पॉलिसी ऑप्टिमाइज़ेशन विधि है जो तर्क करने वाले भाषा मॉडलों (reasoning language models) के लिए है, जो स्केलर ग्रुप एडवांटेज को पेयरवाइज डिकम्पोज्ड एडवांटेज से बदलकर सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) को उन्नत करती है ताकि सूक्ष्म संबंधात्मक जानकारी को संरक्षित किया जा सके, जिससे GRPO जैसे मौजूदा दृष्टिकोणों की तुलना में गणितीय और वैज्ञानिक बेंचमार्क पर अधिक स्थिर प्रशिक्षण और बेहतर प्रदर्शन प्राप्त होता है।