Near-Policy: Accelerating On-Policy Distillation via Asynchronous Generation and Selective Packing
यह शोध पत्र नियर-पॉलिसी डिस्टिलेशन (NPD) का प्रस्ताव करता है, जो एक एसिंक्रोनस फ्रेमवर्क है जो जनरेशन को ट्रेनिंग से अलग करके और पॉलिसी विलंब (policy delay) को कम करने के लिए -IFD फ़िल्टरिंग का उपयोग करके ऑन-पॉलिसी नॉलेज डिस्टिलेशन को तेज़ करता है, जिससे मानक SFT और बड़े मॉडलों की तुलना में 8.1 गुना गति और बेहतर प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Near-Policy Distillation" पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।
बड़ी समस्या: "शिक्षक-छात्र" का अंतर (The "Teacher-Student" Discrepancy)
कल्प Imagine कीजिए कि आप एक छात्र (एक छोटा AI मॉडल) को एक मास्टर टीचर (एक विशाल AI मॉडल) की नकल करके निबंध लिखना सिखा रहे हैं।
- पुराना तरीका (Standard Distillation): आप छात्र को उन निबंधों की एक सूची देते हैं जो टीचर ने पहले ही लिख लिए हैं। छात्र उन्हें रट लेता है। हालाँकि, जब छात्र अपनी परीक्षा देता है, तो उसे शून्य से शुरुआत करनी होती है। चूँकि उसने केवल टीचर के सटीक उत्तरों को याद किया है, इसलिए जब उसे अपने खुद के वाक्य बनाने होते हैं, तो वह भ्रमित हो जाता है। यह एक ऐसे छात्र की तरह है जो एक स्क्रिप्ट तो सुना सकता है, लेकिन जब उससे बिना तैयारी के बोलने को कहा जाता है, तो वह जम जाता है।
- "On-Policy" वाला तरीका (महंगा समाधान): इसे ठीक करने के लिए, छात्र पहले अपने स्वयं के निबंध लिखता है और फिर उन्हें सुधार के लिए टीचर को दिखाता है। यह शानदार काम करता है क्योंकि छात्र अपनी गलतियों से सीखता है। हालाँकि, यह बहुत धीमा है। हर बार जब छात्र एक वाक्य लिखता है, तो टीचर को रुकना पड़ता है, उसे पढ़ना पड़ता है, उसका मूल्यांकन करना पड़ता है और फीडबैक देना पड़ता है, इससे पहले कि छात्र अगला वाक्य लिखने के लिए स्वतंत्र हो सके। यह एक ऐसे ट्यूटर की तरह है जो छात्र को एक भी शब्द लिखने देने से पहले पिछले वाक्य का मूल्यांकन करने से मना कर देता है।
समाधान: Near-Policy Distillation (NPD)
लेखक Near-Policy Distillation नामक एक नई विधि प्रस्तावित करते हैं। इसे एक हाई-स्पीड असेंबली लाइन के रूप में कल्पना करें जो "On-Policy" विधि के लाभों को उसकी सुस्ती के बिना बनाए रखती है।
यह कैसे काम करता है, यहाँ तीन भागों में दिया गया है:
1. एसिंक्रोनस असेंबली लाइन (Decoupling)
टीचर और स्टूडेंट के बीच एक धीमी, एक-से-एक बातचीत के बजाय, NPD उन्हें अलग कर देता है।
- छात्र का कार्य: छात्र मॉडल एक कंप्यूटर पर तेज़ी से चलता है और एक साथ हज़ारों निबंध (प्रतिक्रियाएं) उत्पन्न करता है, जैसे कि एक फैक्ट्री सामानों का उत्पादन करती है। वह टीचर का इंतज़ार नहीं करता।
- टीचर का कार्य: एक बार जब छात्र के पास निबंधों का एक बड़ा ढेर जमा हो जाता है, तो टीचर मॉडल उन सभी की एक साथ समीक्षा करता है। चूँकि टीचर छात्र के टाइप करने का इंतज़ार नहीं कर रहा है, इसलिए वे उन्हें "बैचेस" (batches) में प्रोसेस कर सकते हैं (जैसे कि पेज दर पेज पढ़ने के बजाय एक बार में पूरी किताब का अध्याय पढ़ना)।
- परिणाम: यह पुराने धीमे तरीके की तुलना में 8.1 गुना तेज़ है क्योंकि कंप्यूटर फीडबैक के लिए खाली नहीं बैठा रहता।
2. "सेफ्टी फ़िल्टर" (The ∆-IFD Mechanism)
यहाँ एक पेच है। चूँकि छात्र टीचर द्वारा मूल्यांकन किए जाने से पहले ही निबंध बना लेता है, इसलिए छात्र अपने ही विचारों के "नशे" में आ सकता है। वह बकवास या ऐसी चीज़ें लिखना शुरू कर सकता है जो पूरी तरह से गलत हैं क्योंकि उनकी "पॉलिसी" (सोचने का तरीका) टीचर से दूर भटक गई है।
इसे ठीक करने के लिए, पेपर एक इंटेलिजेंट फ़िल्टर पेश करता है जिसे ∆-IFD कहा जाता है।
- उपमा: कल्पना कीजिए कि छात्र एक नौसिखिया रसोइया है और टीचर एक मिशेलिन-स्टार शेफ है। छात्र कई व्यंजन बनाता है।
- ज़ोन 1 (Degenerate): छात्र कुछ इतना सरल और अजीब बनाता है (जैसे कि सादा पानी का कटोरा) कि टीचर भी सोचता है कि यह बहुत ही साधारण है, लेकिन छात्र भ्रमित है। फ़िल्टर इसे हटा देता है।
- ज़ोन 2 (Cognitive Decoupling): छात्र एक ऐसा व्यंजन बनाता है जिसमें वह बहुत आश्वस्त है, लेकिन मिशेलिन शेफ उसे बेकार मानता है। यह खतरनाक है क्योंकि छात्र अपनी गलती पर अड़ा हुआ है। फ़िल्टर इसे हटा देता है।
- ज़ोन 3 (The Proximal Learning Zone): छात्र कुछ ऐसा बनाता है जो उसके कौशल स्तर से थोड़ा ऊपर है, और टीचर भी सहमत है कि यह अच्छा और मददगार है। छात्र केवल इसी ज़ोन से सीखता है।
यह फ़िल्टर यह सुनिश्चित करता है कि छात्र केवल "गोल्डिलॉक्स" (Goldilocks) उदाहरणों से सीखे—न बहुत आसान, न बहुत कठिन, और न ही खतरनाक रूप से गलत। यह प्रशिक्षण को स्थिर रखता है भले ही छात्र और टीचर वास्तविक समय (real time) में संवाद नहीं कर रहे हों।
3. "स्पार्स अपडेट" (The Occasional Reset)
आमतौर पर, इन तेज़ असेंबली लाइनों के साथ, छात्र के विचार समय के साथ टीचर की शैली से बहुत दूर भटक सकते हैं।
- समाधान: पूरी फैक्ट्री को हर एक सेकंड में सिंक्रोनाइज़ करने के लिए रोकने के बजाय (जो कि धीमा है), NPD लाइन को केवल कभी-कभार रोकने के लिए उपयोग करता है ताकि छात्र के दिमाग को टीचर की वर्तमान शैली के अनुसार रीसेट किया जा सके।
- परिणाम: पेपर ने पाया कि पूरे प्रशिक्षण के दौरान सब कुछ सही रखने के लिए ऐसे "रीसेट" की आवश्यकता केवल एक या दो बार होती है, जिससे बहुत सारा समय बचता है।
ग्रैंड फिनाले: एक सुपर-स्टूडेंट
पेपर दिखाता है कि यह विधि न केवल छात्र को तेज़ी से प्रशिक्षित करती है, बल्कि उसे स्मार्ट भी बनाती है।
- परिणाम: उन्होंने एक छोटा 1-बिलियन पैरामीटर वाला मॉडल (एक "छोटा" AI) लिया और इस विधि के साथ उसे प्रशिक्षित किया।
- तुलना: इस नन्हे मॉडल ने NPD और कुछ अतिरिक्त Reinforcement Learning के बाद एक कठिन रीजनिंग टेस्ट पर 68.73% प्राप्त किया।
- चौंकाने वाला तथ्य: इसने एक बहुत बड़े, प्रसिद्ध मॉडल Qwen3-1.7B (जिसके 1.7 बिलियन पैरामीटर्स हैं) को भी मात दे दी, जिसने 63.69% प्राप्त किया था।
सारांश
Near-Policy Distillation एक हाई-स्पीड फैक्ट्री की तरह है जहाँ एक छात्र टीचर के फीडबैक से सीखता है, बिना लाइन में लगे इंतज़ार किए। यह खराब उदाहरणों को हटाने के लिए एक इंटेलिजेंट फ़िल्टर का उपयोग करता है और छात्र को सही रास्ते पर रखने के लिए कभी-कभार रीसेट का उपयोग करता है। परिणाम स्वरूप, एक छोटा AI बनता है जो बड़े मॉडलों की तुलना में तेज़ी से, सस्ते में और अधिक स्मार्ट तरीके से सीखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।