RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training
यह शोध पत्र इस मानक अभ्यास को चुनौती देता है कि सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) के बाद ही सुदृढीकरण शिक्षण (RL) लागू किया जाता है, यह प्रदर्शित करते हुए कि प्री-ट्रेनिंग में RL को पहले एकीकृत करना, डेटा संरचना को अनुकूलित करना और RL को SFT उद्देश्यों के साथ मिलाना, सामान्य क्षमताओं को संरक्षित करते हुए तर्क करने की क्षमताओं को प्रभावी ढंग से बढ़ा सकता है और मॉडल वितरण का विस्तार कर सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन कच्चे छात्र (AI मॉडल) को गणित की समस्याएं हल करने के लिए प्रशिक्षित कर रहे हैं। वर्षों से, मानक रेसिपी तीन चरणों वाली रही है:
- प्री-ट्रेनिंग (Pre-training): छात्र सामान्य भाषा और तथ्यों को सीखने के लिए लाखों किताबें पढ़ता है।
- SFT (सुपरवाइज्ड फाइन-ट्यूनिंग): एक शिक्षक छात्र को एक पाठ्यपुस्तक देता है जिसमें समस्याएं और उनके सटीक सही उत्तर होते हैं, जिससे छात्र को समाधान पथ को याद करने के लिए मजबूर किया जाता है।
- RL (रीइन्फोर्समेंट लर्निंग): छात्र को एक खेल में डाला जाता है जहाँ उन्हें केवल सही उत्तर देने के लिए अंक मिलते हैं, जो उन्हें अपने आप समस्याओं को हल करने के नए तरीके खोजने के लिए प्रोत्साहित करता है।
यह शोध पत्र पूछता है: क्या हमें वास्तव में गेम खेलने देने से पहले छात्र के सभी किताबें पढ़ लेने और पाठ्यपुस्तक को याद कर लेने का इंतज़ार करना होगा?
यहाँ शोधकर्ताओं ने क्या पाया है, जिसे सरल रूप में समझाया गया है:
1. आप खेल को जल्दी शुरू कर सकते हैं
मानक नियम कहता है, "छात्र को पूरा प्रशिक्षित होने के बाद ही उन्हें खेल दें।" शोधकर्ताओं ने छात्र को उनके पहले कुछ अध्याय पढ़ते समय ही (प्री-ट्रेनिंग के शुरुआती चरण में) खेल (RL) देने की कोशिश की।
- परिणाम: यह आश्चर्यजनक रूप से अच्छा काम कर गया! भले ही छात्र ने बहुत कम किताबें पढ़ी थीं, खेल खेलने से उन्हें गणित की समस्याएं हल करने में केवल अधिक किताबें पढ़ने की तुलना में बहुत बेहतर मदद मिली। वास्तव में, खेल को जल्दी खेलना अक्सर अंत तक प्रतीक्षा करने और पूरी "पढ़ें → याद करें → खेलें" की प्रक्रिया करने जितना ही प्रभावी था।
2. "खेल" तब बेहतर होता है जब आपके पास कोई पाठ्यपुस्तक न हो
आमतौर पर, "याद करने" (SFT) के चरण के लिए एक सही उत्तरों वाली पाठ्यपुस्तक की आवश्यकता होती है। लेकिन क्या होगा यदि आपके पास पर्याप्त पाठ्यपुस्तकें नहीं हैं?
- निष्कर्ष: यदि आपके पास किसी समस्या को हल करने के केवल एक या दो उदाहरण हैं, तो "याद करने" वाला चरण विफल हो जाता है। लेकिन "खेल" (RL) इसमें फलता-फूलता है। छात्र बिना किसी सटीक उत्तर कुंजी की आवश्यकता के, अपने आप समाधान खोजने के लिए अन्वेषण (explore) करना सीखता है। जब आपके पास उदाहरणों की कमी होती है, तो खेल एक बहुत अधिक शक्तिशाली शिक्षक होता है।
3. गुप्त सामग्री किताबों का प्रकार है, छात्र का आकार नहीं
लोग अक्सर सोचते हैं, "यदि छात्र बड़ा (अधिक शक्तिशाली) है, तो वह बेहतर सीखेगा।" शोधकर्ताओं ने छात्र को बड़ा बनाकर इसका परीक्षण किया।
- ट्विस्ट: छात्र को बड़ा बनाने से उन्हें खेल तेजी से सीखने में मदद नहीं मिली। हालांकि, उनके शुरुआती पठन चरण के दौरान उन्हें विशेष रूप से अधिक गणित की किताबें देने से मदद मिली।
- सबक: यदि आप चाहते हैं कि छात्र गणित में अच्छा हो, तो उन्हें शुरुआत में ही गणित की कहानियाँ खिलाएं। आप जो पढ़ रहे हैं उसका कंटेंट (सामग्री) उसके आकार से अधिक महत्वपूर्ण है।
4. "शार्पनिंग" (तेज़ करना) का मिथक बनाम "एक्सपेंशन" (विस्तार)
हाल ही में एक बहस छिड़ी है: क्या "खेल" (RL) केवल छात्र के मौजूदा उत्तरों को अधिक सटीक और आत्मविश्वासी बनाता है, या यह वास्तव में उन्हें सोचने के नए तरीके सिखाता है?
- पुराना दृष्टिकोण: कई लोगों का मानना था कि RL केवल छात्र को "शार्प" करता है, जिससे वे आत्मविश्वासी तो बनते हैं लेकिन आवश्यक रूप से स्मार्ट नहीं।
- नई खोज: शोधकर्ताओं ने पाया कि "शार्पनिंग" का प्रभाव वास्तव में "याद करने" वाले चरण (SFT) के कारण होता है। जब आप छात्र को पहले एक पाठ्यपुस्तक याद करने के लिए मजबूर करते हैं, तो वे अन्वेषण करना बंद कर देते हैं।
- असली जादू: यदि आप छात्र को पाठ्यपुस्तक को याद करने के बजाय सीधे खेल खेलने देते हैं, तो वे वास्तव में अपने सोचने के दायरे का विस्तार करते हैं। वे कई अलग-अलग रास्तों को आज़माते हैं और ऐसे समाधान खोजते हैं जिन्हें वे पहले कभी नहीं जानते थे। "याद करने" वाला चरण ही उनकी रचनात्मकता को सीमित करता है, न कि खेल।
5. "सुपर-स्टूडेंट" रेसिपी
शोधकर्ताओं ने दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिला दिया। "याद करें" फिर "खेलें" करने के बजाय, उन्होंने छात्र को दोनों एक साथ करने के लिए कहा।
- यह कैसे काम करता है: कल्पना कीजिए कि छात्र एक समस्या हल कर रहा है। उनके मस्तिष्क का एक हिस्सा पाठ्यपुस्तक (SFT) की जाँच कर रहा है, और दूसरा हिस्सा नए विचारों के साथ प्रयोग (RL) कर रहा है। वे अपने मस्तिष्क को अपडेट करने के लिए दोनों हिस्सों की सलाह का औसत (average) लेते हैं।
- परिणाम: यह "सुपर-स्टूडेंट" (पैरेलल एवरेजिंग) समस्याओं को हल करने में सबसे अच्छा बना। वे किसी भी अन्य व्यक्ति की तुलना में अधिक बार सही उत्तर प्राप्त करते थे, और केवल पाठ्यपुस्तक को याद करने वाले छात्रों के विपरीत, वे अन्य चीजें (जैसे सामान्य बातचीत) करना नहीं भूले।
मुख्य निष्कर्षों का सारांश
- इंतज़ार न करें: आप मॉडल के जीवन के बहुत शुरुआती चरण में, यहाँ तक कि उसके "पढ़ने" के चरण के पूरा होने से पहले भी, रीइन्फोर्समेंट लर्निंग (खेल) का उपयोग कर सकते हैं।
- आकार से अधिक डेटा मायने रखता है: प्री-ट्रेनिंग के दौरान मॉडल को विशिष्ट प्रकार का डेटा (जैसे गणित) खिलाना, मॉडल को केवल बड़ा बनाने से अधिक महत्वपूर्ण है।
- RL खलनायक नहीं है: RL मॉडल के सामान्य कौशल को खराब नहीं करता है या केवल उसे "शार्प" नहीं करता है। वे नकारात्मक प्रभाव "याद करने" (SFT) के चरण से आते हैं। RL वास्तव में मॉडलों को अन्वेषण करने और नए समाधान खोजने में मदद करता है।
- साथ मिलकर करें: सबसे अच्छे परिणाम "याद करने" और "खेलने" के चरणों को एक के बाद एक करने के बजाय, उन्हें एक साथ मिलाने से मिलते हैं।
संक्षेप में, यह शोध पत्र सुझाव देता है कि हमें रीइन्फोर्समेंट लर्निंग को प्रशिक्षण प्रक्रिया के बिल्कुल अंत में एक अंतिम पॉलिश के रूप में देखने के बजाय, इसे बहुत पहले ही शामिल करना चाहिए और अधिक स्मार्ट, अधिक सक्षम मॉडल प्राप्त करने के लिए इसे अन्य विधियों के साथ मिलाना चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।