PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
PCL-Reasoner-V1.5 एक 32-बिलियन-पैरामीटर वाला गणितीय तर्क मॉडल है जो Qwen2.5-32B पर आधारित है और जो ऑनलाइन RL दृष्टिकोणों की तुलना में बेहतर प्रशिक्षण स्थिरता और दक्षता के साथ AIME बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक नवीन ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) पद्धति का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ PCL-Reasoner-V1.5 पेपर का विवरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के साथ समझाया गया है।
बड़ी तस्वीर: एक डाइट पर गणित का जादूगर
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान छात्र (AI मॉडल) है जो पहले से ही गणित में अच्छा है लेकिन वह एक विश्व-स्तरीय चैंपियन बनना चाहता है। Peng Cheng Laboratory और Peking University के शोधकर्ताओं ने एक शक्तिशाली छात्र Qwen2.5-32B को लिया और उसे एक विशेष ट्रेनिंग कैंप में भेजा ताकि PCL-Reasoner-V1.5 बनाया जा सके।
परिणाम? यह नया मॉडल वर्तमान में इस विशिष्ट "छात्र" आधार पर बने मॉडलों में कठिन गणितीय समस्याओं को हल करने में सर्वश्रेष्ठ है। इसने 2024 की एक गणित प्रतियोगिता में 90.9% और 2025 के एक संस्करण में 85.6% अंक प्राप्त किए।
सीक्रेट सॉस: दो-चरणीय प्रशिक्षण (Two-Step Training)
शोधकर्ताओं ने मॉडल को केवल एक रैंडम प्रैक्टिस सेशन में नहीं डाला। उन्होंने एक दो-चरणीय प्रक्रिया का उपयोग किया:
सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) – "टेक्स्टबुक चरण":
सबसे पहले, उन्होंने मॉडल को उच्च गुणवत्ता वाले गणित के प्रश्नों और उनके चरण-दर-चरण समाधानों (जिसे Chain-of-Thought कहा जाता है) के एक विशाल पुस्तकालय का उपयोग करके सिखाया। इसे ऐसे समझें जैसे छात्र सबसे अच्छी टेक्स्टबुक्स पढ़ रहा हो और समस्याओं को सही ढंग से हल करने का तरीका याद कर रहा हो। इससे एक मध्यवर्ती मॉडल बना जिसे PCL-Reasoner-V1 कहा गया।ऑफलाइन रीइन्फोर्समेंट लर्निंग (RL) – "प्रैक्टिस एग्जाम चरण":
यहीं पर यह पेपर अभिनव (innovative) है। आमतौर पर, AI मॉडल एक टेस्ट देते हैं, तुरंत ग्रेड प्राप्त करते हैं, और फिर दोबारा प्रयास करते हैं जबकि शिक्षक उन्हें देख रहा होता है (इसे Online RL कहा जाता है)। यह एक छात्र की तरह है जो एक टेस्ट देता है, एक ग्रेड पाता है, और फिर अपनी गलती सुधारने के लिए तुरंत अपने दिमाग को बदल लेता है, और यह सब रियल-टाइम में होता है। यह अराजक और धीमा हो सकता है।PCL-Reasoner-V1.5 ने इसके बजाय Offline RL का उपयोग किया। यहाँ इसका उदाहरण दिया गया है:
- पुराना तरीका (Online RL): छात्र एक टेस्ट देता है, शिक्षक ग्रेड देता है, छात्र अपने दिमाग को बदलता है, और फिर वह तुरंत अगला टेस्ट देता है। यदि शिक्षक थक जाता है या ग्रेडिंग सिस्टम में कोई गड़बड़ी आती है, तो पूरी प्रक्रिया क्रैश हो जाती है।
- नया तरीका (Offline RL): छात्र एक साथ अभ्यास परीक्षाओं का एक बड़ा ढेर लेता है और अपने सभी उत्तर लिख देता है। शिक्षक उस पूरे ढेर को बाद में ग्रेड करता है और एक एकल, पूर्ण "उत्तर कुंजी" (Answer Key) पुस्तक बनाता है। छात्र फिर केवल इसी स्थिर पुस्तक से अध्ययन करता है। वे अध्ययन के दौरान नए टेस्ट नहीं लेते; वे बस इस निश्चित डेटा से सीखते हैं।
"ऑफलाइन" बेहतर क्यों है?
पेपर का तर्क है कि यह "उत्तर कुंजी" दृष्टिकोण (Offline RL) तीन मुख्य कारणों से बेहतर है:
- स्थिरता (कोई रोलरकोस्टर नहीं): ऑनलाइन लर्निंग वैसी ही है जैसे इंजन को फिर से बनाते समय कार चलाना। यह अस्थिर है और क्रैश हो सकती है। ऑफलाइन लर्निंग एक शांत लाइब्रेरी में अध्ययन करने जैसा है; डेटा बदलता नहीं है, इसलिए सीखने की प्रक्रिया सुचारू और अनुमानित होती है।
- दक्षता (एक असेंबली लाइन): ऑनलाइन विधि में, कंप्यूटर को लगातार रुकना, सोचना, ग्रेड करना और अपडेट करना पड़ता है। ऑफलाइन विधि में, कंप्यूटर एक ही बार में सभी उत्तरों को एक बड़े, कुशल विस्फोट (जैसे फैक्ट्री असेंबली लाइन) में उत्पन्न कर सकता है, और फिर प्रशिक्षण अलग से होता है। इससे बहुत समय और कंप्यूटिंग पावर बचती है।
- सरलता: इसे प्रबंधित करना आसान है। आपको रियल-टाइम ग्रेडिंग और लर्निंग को समन्वयित करने के लिए एक जटिल प्रणाली की आवश्यकता नहीं है। आप बस डेटा जेनरेट करते हैं, उसे सहेजते हैं, और बाद में उस पर प्रशिक्षण लेते हैं।
मॉडल ने वास्तव में क्या सीखा?
शोधकर्ताओं ने गौर किया कि मॉडल में सुधार कैसे हुआ।
- पहले (PCL-Reasoner-V1): मॉडल समस्याओं को जल्दी हल करने की कोशिश करता था। यदि किसी समस्या के लिए बहुत लंबी, जटिल तर्क श्रृंखला (जैसे 30,000 शब्दों की विचार प्रक्रिया) की आवश्यकता होती थी, तो मॉडल अक्सर हार मान लेता था या गलतियाँ करता था।
- बाद में (PCL-Reasoner-V1.5): मॉडल ने लंबे समय तक सोचने के लिए सीखा। इसने बहुत लंबे, विस्तृत तर्क चरण लिखना शुरू कर दिया। इसने सीखा कि कठिन समस्याओं के लिए, आप जल्दबाजी नहीं कर सकते; आपको हर रास्ते को सावधानीपूर्वक खोजना होगा।
निचोड़ (The Bottom Line)
पेपर का दावा है कि शानदार परिणाम प्राप्त करने के लिए आपको उन जटिल, अस्थिर, रियल-टाइम "ऑनलाइन" प्रशिक्षण विधियों की आवश्यकता नहीं है जिनका उपयोग अन्य सभी कर रहे हैं। एक सरल, अधिक स्थिर "ऑफलाइन" विधि का उपयोग करके—जहाँ आप उत्तरों का एक निश्चित डेटासेट जेनरेट करते हैं और फिर उस पर प्रशिक्षण लेते हैं—मॉडल गणित का चैंपियन बन गया।
मुख्य बात: कभी-कभी, सीखने का सबसे अच्छा तरीका यह नहीं है कि आप टेस्ट देते रहें जब शिक्षक आपको देख रहा हो। यह है कि अभ्यास टेस्टों का एक बड़ा बैच लें, एक पूर्ण उत्तर कुंजी प्राप्त करें, और उस कुंजी का पूरी गहराई से अध्ययन करें। इस दृष्टिकोण ने PCL-Reasoner-V1.5 को उसके वर्ग में नया शीर्ष प्रदर्शन करने वाला बना दिया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।