PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
PCL-Reasoner-V1.5 एक 32-बिलियन-पैरामीटर वाला गणितीय तर्क मॉडल है जो Qwen2.5-32B पर आधारित है और जो ऑनलाइन RL दृष्टिकोणों की तुलना में बेहतर प्रशिक्षण स्थिरता और दक्षता के साथ AIME बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक नवीन ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) पद्धति का लाभ उठाता है।