Reinforcement-aware Knowledge Distillation for LLM Reasoning
यह शोध पत्र RL-aware Distillation (RLAD) का प्रस्ताव करता है, जो एक विधि है जो वितरण बेमेल (distribution mismatch) और उद्देश्य हस्तक्षेप (objective interference) को दूर करने के लिए Trust Region Ratio Distillation (TRRD) ऑब्जेक्टिव के माध्यम से सुदृढीकरण शिक्षण (reinforcement learning) में चयनात्मक अनुकरण (selective imitation) को एकीकृत करती है, जिससे छोटे भाषा मॉडल अन्वेषण (exploration) और दोहन (exploitation) को संतुलित करते हुए बड़े शिक्षकों से प्रभावी ढंग से लंबी चेन-ऑफ-थॉट (chain-of-thought) तर्क क्षमताओं को विरासत में प्राप्त कर पाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार, लेकिन अविश्वसनीय रूप से महंगे मास्टर शेफ (शिक्षक) हैं जो पूर्ण तर्क के साथ जटिल, बहु-कोर्स भोजन बना सकते हैं। आप एक छोटे, तेज़ और सस्ते प्रशिक्षु शेफ (छात्र) को मास्टर की तरह खाना बनाना सिखाना चाहते हैं, ताकि आप बिना बहुत अधिक खर्च किए अधिक लोगों को बेहतरीन भोजन परोस सकें।
लंबे समय तक, प्रशिक्षु को सिखाने का तरीका सरल था: मास्टर की रेसिपी बुक की नकल करना। प्रशिक्षु बस उन सटीक चरणों को याद कर लेता था जो मास्टर ने अतीत में लिए थे। यह ठीक काम करता है, लेकिन यह कठोर है। यदि प्रशिक्षु कुछ थोड़ा अलग बनाने की कोशिश करता है या किसी नए घटक (ingredient) का सामना करता है, तो वह अटक जाता है क्योंकि वह केवल पुराने नोट्स का अंधाधुंध पालन कर रहा है, न कि खाना पकाने के बारे में सोचना सीख रहा है।
हाल ही में, शेफों ने एक नया तरीका इस्तेमाल करना शुरू किया है: फीडबैक के साथ परीक्षण और त्रुटि (Trial and Error with Feedback)। प्रशिक्षु खाना बनाना शुरू करता है, उसे व्यंजन के स्वाद के आधार पर एक स्कोर (रिवॉर्ड) मिलता है, और अगली बार बेहतर स्कोर पाने के लिए वह अपनी तकनीक को समायोजित करता है। यह सीखने के लिए बहुत अच्छा है, लेकिन यह धीमा और महंगा है।
समस्या तब आती है जब आप इन दोनों तरीकों को मिलाने की कोशिश करते हैं। यदि आप प्रशिक्षु को कहते हैं, "तुम्हें मास्टर के चरणों की नकल भी करनी है और उच्च स्वाद स्कोर भी प्राप्त करना है," तो वे अक्सर भ्रमित हो जाते हैं।
- कभी-कभी मास्टर के पुराने चरण वर्तमान स्थिति के लिए सबसे अच्छा स्वाद स्कोर नहीं देते हैं।
- "नकल करने" का निर्देश "उच्च स्कोर प्राप्त करने" के निर्देश के विरुद्ध लड़ता है, जिससे प्रशिक्षु डगमगा जाता है और खराब तरीके से सीखता है।
नया समाधान: "स्मार्ट इमिटेशन" (RLAD)
लेखकों ने इस शोध पत्र में RLAD (रीइन्फोर्समेंट-अवेयर डिस्टिलेशन) नामक एक नया तरीका प्रस्तावित किया है। प्रशिक्षु को हर समय 100% मास्टर की नकल करने के लिए मजबूर करने के बजाय, वे एक "स्मार्ट इमिटेशन" नियम पेश करते हैं।
यहाँ एक जीपीएस (GPS) उपमा का उपयोग करके मुख्य विचार दिया गया है:
- लक्ष्य: प्रशिक्षु एक ऐसे गंतव्य तक जाना चाहता है जो उच्चतम "रिवॉर्ड" (जैसे कि एक बेहतरीन दृश्य) देता हो।
- पुराना तरीका (स्टैंडर्ड डिस्टिलेशन): जीपीएस (शिक्षक) लगातार चिल्लाता है, "बाएं मुड़ें! बाएं मुड़ें!" भले ही सड़क अवरुद्ध हो या कोई बेहतर मार्ग मौजूद हो। प्रशिक्षु अंधाधert होकर उसका पालन करता है, भले ही वह उसे एक डेड एंड (बंद रास्ते) की ओर ले जाए।
- नया तरीका (RLAD): जीपीएस केवल तभी निर्देश देता है जब वह एक बेहतर दृश्य पाने के प्रशिक्षु की वर्तमान योजना के साथ सहमत होता है।
- यदि प्रशिक्षु एक शानदार दृश्य की ओर बढ़ रहा है (उच्च रिवॉर्ड) और जीपीएस कहता है, "हाँ, यह एक अच्छा मोड़ है," तो प्रशिक्षु जीपीएस का बारीकी से पालन करता है।
- यदि प्रशिक्षु एक शानदार दृश्य की ओर बढ़ रहा है लेकिन जीपीएस कहता है, "नहीं, दाएं मुड़ें," तो प्रशिक्षु जीपीएस को अनदेखा कर देता है क्योंकि "स्वाद स्कोर" (रिवॉर्ड) कहता है कि वर्तमान पथ बेहतर है।
- यदि प्रशिक्षु खो गया है (कम रिवॉर्ड), तो जीपीएस उसे वापस एक सुरक्षित, ज्ञात पथ पर मार्गदर्शन करने के लिए हस्तक्षेप करता है।
गुप्त नुस्खा: "ट्रस्ट ज़ोन" (TRRD)
इसे बिना प्रशिक्षु को पागल किए काम करने योग्य बनाने के लिए, शोध पत्र एक तकनीक का उपयोग करता है जिसे ट्रस्ट रीजन रेशियो डिस्टिलेशन (TRRD) कहा जाता है।
इसे प्रशिक्षु से जुड़ी एक सुरक्षा लीश (Safety Leash) के रूप में सोचें।
- यह लीश प्रशिक्षु के उस स्थान से जुड़ी है जहाँ वह एक क्षण पहले था और उस स्थान से भी जहाँ मास्टर जाता।
- प्रशिक्षु को नए रास्तों को खोजने (Exploration) या जो वह जानता है उस पर टिके रहने (Exploitation) के लिए स्वतंत्र रूप से दौड़ने की अनुमति है।
- हालाँकि, यदि प्रशिक्षु मास्टर के ज्ञान द्वारा परिभाषित "सेफ ज़ोन" से बहुत दूर जाने की कोशिश करता है, तो लीश उसे धीरे से वापस खींच लेती है।
- महत्वपूर्ण बात यह है कि लीश केवल तभी कसती है जब मास्टर की सलाह वास्तव में प्रशिक्षु को बेहतर स्कोर प्राप्त करने में मदद करती है। यदि मास्टर वर्तमान स्थिति के लिए गलत है, तो लीश ढीली रहती है, जिससे प्रशिक्षु को एक बेहतर रास्ता खोजने की अनुमति मिलती है।
उन्होंने क्या पाया?
शोधकर्ताओं ने दो प्रकार की "कुकिंग चुनौतियों" पर इसका परीक्षण किया:
- तर्क पहेलियाँ (Logic Puzzles): जैसे किसी जटिल रहस्य या लॉजिस्टिक्स समस्या को सुलझाना।
- गणित की समस्याएँ (Math Problems): जैसे कठिन समीकरणों या प्रतियोगिता गणित को हल करना।
परिणाम:
- बेहतर स्कोर: इस नए "स्मार्ट इमिटेशन" विधि से प्रशिक्षित प्रशिक्षुओं ने केवल नकल करने वाले या केवल अनुमान लगाने वाले प्रशिक्षुओं की तुलना में काफी उच्च स्कोर प्राप्त किए।
- कठिन समस्याएँ: सुधार सबसे अधिक कठिन समस्याओं पर देखा गया। आसान समस्याओं पर, सभी ने ठीक प्रदर्शन किया, लेकिन "असंभव" वाली समस्याओं पर, नया तरीका चमक उठा।
- स्थिरता (Stability): प्रशिक्षण बहुत सहज था। पुराने तरीकों में अक्सर प्रशिक्षु डगमगा जाता था और प्रगति खो देता था (अस्थिरता), लेकिन नया तरीका उन्हें शीर्ष तक एक स्थिर पथ पर रखता है।
- वास्तविक सीखना बनाम नकल करना: पुराने तरीकों ने मुख्य रूप से प्रशिक्षु को मास्टर के विशिष्ट उत्तरों को याद करने के लिए बनाया (जो कई बार अनुमान लगाने के लिए अच्छा है, लेकिन एक ही बार में सर्वश्रेष्ठ उत्तर खोजने के लिए बुरा है)। नया तरीका वास्तव में पहली बार में ही सबसे अच्छा उत्तर खोजने की प्रशिक्षु की क्षमता में सुधार करता है।
संक्षेप में
यह शोध पत्र छोटे AI मॉडल को तर्क करने के लिए सिखाने का एक स्मार्ट तरीका पेश करता है। उन्हें एक बड़े, बुद्धिमान शिक्षक की अंधाधुंध नकल करने के लिए मजबूर करने के बजाय, यह उन्हें शिक्षक की बात तभी सुनने के लिए सिखाता है जब शिक्षक की सलाह उन्हें जीतने में मदद करती है। यह एक ऐसा छात्र बनाता है जो बुद्धिमान (मास्टर की तरह) और अनुकूलन योग्य (बेहतर समाधान खोजने में सक्षम) दोनों है, और यह सब तेजी से और अधिक स्थिरता के साथ प्रशिक्षण देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।