Scaling Reasoning Efficiently via Relaxed On-Policy Distillation
यह शोधपत्र REOPOLD को प्रस्तुत करता है, जो एक नवीन ढांचा है जो ऑन-पॉलिसी डिस्टिलेशन को पॉलिसी ऑप्टिमाइज़ेशन के रूप में व्याख्यायित करता है और इसे शिथिल बाधाओं (relaxed constraints) एवं गतिशील रिवॉर्ड तंत्रों के माध्यम से स्थिर करता है, जिससे काफी उच्च सैंपल दक्षता प्राप्त होती है और छोटे मॉडलों को विविध कार्यों में बड़े शिक्षकों के रीजनिंग प्रदर्शन के बराबर लाने में सक्षम बनाया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक युवा, ऊर्जावान प्रशिक्षु (एक छोटा AI मॉडल) को जटिल पहेलियाँ, जैसे कि उन्नत गणित या दृश्य पहेलियाँ (visual riddles) हल करना सिखाने की कोशिश कर रहे हैं। आपके पास एक बुद्धिमान, मास्टर शिक्षक (एक विशाल AI मॉडल) है जो अविश्वसनीय रूप से स्मार्ट है लेकिन उसे सोचने में बहुत समय लगता है और उसे चलाना बहुत महंगा है।
लक्ष्य प्रशिक्षु को मास्टर जितना ही स्मार्ट बनाना है, लेकिन अधिक तेज़ और सस्ते तरीके से।
समस्या: "तोता" बनाम "विचारक" (The "Parrot" vs. The "Thinker")
पारंपरिक रूप से, जब हम प्रशिक्षु को सिखाते हैं, तो हम एक विधि का उपयोग करते हैं जिसे On-Policy Distillation कहा जाता है। इसे ऐसे समझें कि प्रशिक्षु वास्तविक समय में मास्टर की हर हरकत की हुबहू नकल करने की कोशिश कर रहा है।
- समस्या: यदि मास्टर एक छोटी सी गलती करता है या एक अजीब रास्ता चुन लेता है, तो प्रशिक्षु बिल्कुल उसकी नकल करने की कोशिश करता है। यदि मास्टर कहता है, "ऐसा मत करो!" बहुत कठोर लहजे में, तो प्रशिक्षु घबरा जाता है और वह सब कुछ भूल जाता है जो वह पहले से जानता था।
- परिणाम: प्रशिक्षु भ्रमित हो जाता है, सीखना बंद कर देता है, या मतिभ्रम (hallucination) का शिकार होने लगता है (वह अपनी ओर से चीजें बनाने लगता है)। यह एक ऐसे छात्र की तरह है जो गलत होने के डर से इतना डरा हुआ है कि उसने सोचना ही छोड़ दिया है और बस जम गया है।
समाधान: REOPOLD (द "रिलैक्स्ड" मेंटर)
लेखकों ने एक नई विधि पेश की है जिसे REOPOLD कहा जाता है। इसमें प्रशिक्षु को मास्टर की हर चीज़ को पूरी तरह से कॉपी करने के लिए मजबूर करने के बजाय, वे एक बुद्धिमान कोच की तरह कार्य करते हैं जो जानता है कि कब दबाव डालना है और कब छात्र को खुद चीजों को समझने देना है।
REOPOLD कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:
1. "सुरक्षा जाल" (The "Safety Net" - Reward Clipping)
पुरानी विधि में, यदि मास्टर कहता, "यह उत्तर बहुत बुरा है!" (एक बहुत बड़ा नकारात्मक स्कोर), तो प्रशिक्षु को एक बड़ा झटका लगता और वह क्रैश हो जाता।
- REOPOLD का सुधार: यह कोच की आवाज़ के नीचे एक "सुरक्षा जाल" लगा देता है। यदि कोच बहुत अधिक क्रोधित या कठोर हो जाता है, तो REOPOLD कहता है, "ठीक है, यह एक बुरा विचार है, लेकिन घबराओ मत।" यह नकारात्मक फीडबैक को सीमित कर देता है ताकि प्रशिक्षु डरकर रुक न जाए। यह "शोर" (noise) को छान देता है और केवल उपयोगी आलोचना पर ध्यान देता है।
2. "हाइलाइटर" (The "Highlighter" - Dynamic Sampling)
कल्पना कीजिए कि प्रशिक्षु एक लंबी पाठ्यपुस्तक पढ़ रहा है। अधिकांश पृष्ठ उबाऊ और स्पष्ट हैं (जैसे "1+1=2")। मास्टर और प्रशिक्षु इन पर पहले से ही सहमत हैं। लेकिन असली सीख उन कुछ पेजों से मिलती है जहाँ पेचीदा और भ्रमित करने वाले चित्र होते हैं।
- REOPOLD का सुधार: यह उन उबाऊ, आसान पेजों को अनदेखा करने के लिए एक हाइलाइटर का उपयोग करता है जहाँ प्रशिक्षु और मास्टर सहमत हैं। यह अपनी पूरी ऊर्जा उन भ्रमित करने वाले, उच्च-अनिश्चितता वाले क्षणों पर केंद्रित करता है। यह एक ऐसे ट्यूटर की तरह है जो आसान होमवर्क को छोड़कर केवल कठिन समस्याओं पर मदद करता है, जिससे सीखना बहुत तेज़ हो जाता है।
3. "दो-चरणीय प्रशिक्षण" (The "Two-Phase Training" - Exploration then Refinement)
- चरण 1 (खेल का मैदान - The Playground): शुरुआत में, कोच प्रशिक्षु को कई अलग-अलग पागलपन भरे विचार आज़माने की अनुमति देता है। भले ही वे गलत हों, कोच उन्हें बहुत अधिक दंडित नहीं करता है। यह प्रशिक्षु को रचनात्मक होने और समस्या को हल करने के विभिन्न तरीकों को खोजने के लिए प्रोत्साहित करता है।
- चरण 2 (अभ्यास - The Drill): एक बार जब प्रशिक्षु ने खोज (explore) कर लिया है, तो कोच अपना मोड बदल देता है। अब, वे सबसे अच्छे विचारों को निखारने और बुरे विचारों को हटाने पर ध्यान केंद्रित करते हैं। यह "रचनात्मक अव्यवस्था" को एक "परिष्कृत कौशल" में बदल देता है।
यह क्यों मायने रखता है (परिणाम)
यह शोध पत्र दिखाता है कि यह नया "रिलैक्स्ड" दृष्टिकोण गेम-चेंजर है:
- अत्यधिक कुशल: प्रशिक्षु पहले की तुलना में 6 से 12 गुना कम डेटा का उपयोग करके समान मात्रा में ज्ञान सीखता है। यह एक भाषा को एक साल के बजाय एक महीने में सीखने जैसा है।
- छोटे मॉडल, बड़ा दिमाग: REOPOLD के साथ प्रशिक्षित एक छोटा 7-बिलियन-पैरामीटर वाला मॉडल (प्रशिक्षु), एक विशाल 32-बिलियन-पैरामीटर वाले मॉडल (मास्टर) के लगभग बराबर दृश्य पहेलियाँ हल कर सकता है, लेकिन यह इसे 3 गुना तेज़ी से करता है।
- कोई क्रैश नहीं: प्रशिक्षण स्थिर है। प्रशिक्षु भ्रमित नहीं होता या हार नहीं मानता; वह लगातार स्मार्ट होता जाता है।
निष्कर्ष (The Bottom Line)
REOPOLD शिक्षक और छात्र के बीच के संबंध को बदलने के बारे में है। एक सख्त तानाशाह की तरह जो पूर्ण नकल की मांग करता है, इसके बजाय यह एक लचीले मेंटर की तरह कार्य करता है जो:
- कठोर आलोचना के झटके को कम करता है।
- केवल कठिन हिस्सों पर ध्यान केंद्रित करता है।
- पूर्णता की मांग करने से पहले खोज (exploration) को प्रोत्साहित करता है।
यह छोटे, तेज़ AI मॉडलों को अपने विशाल शिक्षकों की भारी कंप्यूटिंग शक्ति की आवश्यकता के बिना तर्क करने वाला जीनियस बनने की अनुमति देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।