PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation
PowerOPD अनबाउंडेड (unbounded) लॉग-रेशियो रिवॉर्ड के स्थान पर बॉक्स-कॉक्स पावर ट्रांसफॉर्मेशन से व्युत्पन्न स्वाभाविक रूप से बाउंडेड और साइन-कंसिस्टेंट (sign-consistent) रिवॉर्ड्स के एक परिवार को प्रतिस्थापित करके मानक ऑन-पॉलिसी डिस्टिलेशन की गंभीर प्रशिक्षण अस्थिरता और सैंपल अक्षमता को संबोधित करता है, जिससे कई रीजनिंग बेंचमार्क और मॉडल पेयर्स में बेहतर प्रदर्शन और दक्षता प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन प्रशिक्षु (Student) को एक कुशल शिल्पकार (Teacher) को देखते हुए लिखना सिखाने की कोशिश कर रहे हैं।
लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया में, इस प्रक्रिया को On-Policy Distillation कहा जाता है। लक्ष्य यह है कि प्रशिक्षु अपने स्वयं के ड्राफ्ट पर अभ्यास करते हुए शिक्षक की शैली से सीख सके।
समस्या: "चिल्लाने वाला" शिक्षक
मानक तरीका (जिसे Vanilla OPD कहा जाता है) इस प्रकार काम करता है: हर बार जब प्रशिक्षु एक शब्द लिखता है, तो शिक्षक उसकी तुलना उस शब्द से करता है जो वे लिखते।
- यदि प्रशिक्षु एक ऐसा शब्द चुनता है जिसे शिक्षक पसंद करता है, तो शिक्षक उच्च स्कोर देता है।
- यदि प्रशिक्षु एक अजीब शब्द चुनता है जिसे शिक्षक नापसंद करता है, तो वह कम स्कोर देता है।
खामी: पेपर का तर्क है कि मानक तरीकों में उपयोग किया जाने वाला "स्कोरिंग सिस्टम" टूटा हुआ है। यह ऐसा है जैसे एक शिक्षक जो कोमल "0 से 10" का स्कोर देने के बजाय, एक लॉगरिदमिक स्केल का उपयोग करता है जो -50 से +50 तक बेतहाशा बदल सकता है।
- "दुर्लभ टोकन" का जाल (The "Rare Token" Trap): यदि प्रशिक्षु एक बहुत ही दुर्लभ शब्द चुनता है जिसे शिक्षक नापसंद करता है, तो स्कोर गिरकर -50 हो जाता है। यह एकल, दुर्लभ गलती एक विशाल, चिल्लाता हुआ संकेत भेजती है जो पूरे पाठ (lesson) को दबा देता है।
- शुरुआती गलती: ये चिल्लाते हुए स्कोर ज्यादातर वाक्य के शुरुआत में होते हैं। यदि प्रशिक्षु पहला शब्द गलत चुन लेता है, तो शिक्षक की घबराहट वाली प्रतिक्रिया पूरे वाक्य को बर्बाद कर देती है, जिससे प्रशिक्षु भ्रम के चक्रव्यूह में फंस जाता है।
- परिणाम: प्रशिक्षु भ्रमित हो जाता है, प्रशिक्षण में बहुत समय लगता है, और वे कभी भी मास्टर के स्तर तक नहीं पहुँच पाते।
लेखकों ने इसे "क्लिपिंग" (शिक्षक को शांत रहने के लिए कहना) या "नॉर्मलाइजिंग" (औसत निकालना) करके ठीक करने की कोशिश की, लेकिन ये एक टूटी हुई टांग पर पट्टी लगाने जैसे थे। अंतर्निहित गणित अभी भी त्रुटिपूर्ण था।
समाधान: PowerOPD (एक "सीमित" शिक्षक)
लेखक PowerOPD नामक एक नई विधि प्रस्तावित करते हैं। एक चिल्लाते हुए, असीमित स्केल के बजाय, वे एक बाउंडेड (bounded) स्कोरिंग सिस्टम बनाने के लिए एक गणितीय ट्रिक (जिसे Box-Cox transformation कहा जाता है) का उपयोग करते हैं।
इसे इस प्रकार समझें:
- पुरानी विधि: शिक्षक की आवाज़ एक माइक्रोफ़ोन की तरह है जिसकी कोई वॉल्यूम सीमा नहीं है। यदि छात्र एक छोटी सी गलती करता है, तो शिक्षक इतना ज़ोर से चिल्लाता है कि छात्र के कान टूट जाते हैं।
- PowerOPD: शिक्षक की आवाज़ एक सुरक्षित, अधिकतम वॉल्यूम पर सीमित है। भले ही छात्र एक भयानक गलती करे, शिक्षक कहता है, "यह बुरा है," लेकिन वॉल्यूम कभी भी एक सुरक्षित सीमा से ऊपर नहीं जाता है।
इस नए सिस्टम के पास दो महाशक्तियाँ हैं:
- यह बाउंडेड (Bounded) है: स्कोर कभी पागल नहीं हो सकते। वे एक सुरक्षित सीमा (जैसे -1 से +1) के भीतर रहते हैं।
- यह सुसंगत (Consistent) है: यह हमेशा सही दिशा दिखाता है। यदि शिक्षक को शब्द पसंद आता है, तो स्कोर सकारात्मक होता है; यदि वे उसे नापसंद करते हैं, तो यह नकारात्मक होता है। यह कभी भी यह समझने में भ्रमित नहीं होता कि छात्र को किस दिशा में धकेलना है।
परिणाम: स्मार्ट, तेज़ और शांत
पेपर ने विभिन्न आकार के AI मॉडल्स का उपयोग करके गणित की समस्याओं पर इस नई विधि का परीक्षण किया। यहाँ हुआ:
- बेहतर ग्रेड: प्रशिक्षु बहुत तेज़ी से सीखा और गणित की समस्याओं को हल करने में काफी बेहतर हुआ (औसतन 6.37% अधिक सटीकता)।
- छोटे, स्पष्ट उत्तर: पुरानी विधि ने प्रशिक्षु को बहुत लंबा लिखने के लिए प्रेरित किया, जिससे वे अक्सर अधिकतम लंबाई की सीमा तक पहुँच जाते थे। PowerOPD ने प्रशिक्षु को संक्षिप्त होना सिखाया, जिससे वे छोटे और सीधे उत्तर देते हैं।
- सस्ता प्रशिक्षण: क्योंकि प्रशिक्षण बहुत अधिक स्थिर था, इसलिए इसे लंबे समय तक चलाने की आवश्यकता नहीं थी। इसने पुराने तरीके के सबसे महंगे संस्करण की तुलना में 59% समय और 23% कंप्यूटर मेमोरी बचाई।
- "अल्फा" नॉब (The "Alpha" Knob): इस विधि में एक सेटिंग है जिसे Alpha (α) कहा जाता है। इस नॉब को ऊपर घुमाने से शिक्षक और भी अधिक केंद्रित हो जाता है। उच्च अल्फा मानों ने प्रशिक्षु को तेज़ी से सीखने, छोटे उत्तर देने और प्रशिक्षण प्रक्रिया को अविश्वसनीय रूप से सुचारू बनाए रखने में मदद की (ग्रेडिएंट शोर 3,000 गुना कम हो गया)।
निष्कर्ष
पेपर का दावा है कि AI मॉडल्स को सिखाने का पुराना तरीका इसलिए टूटा हुआ था क्योंकि "रिवॉर्ड्स" (स्कोर) बहुत अनियंत्रित और बेतहाशा थे। एक नए, गणितीय रूप से "बाउंडेड" स्कोरिंग सिस्टम में स्विच करके, उन्होंने अस्थिरता को ठीक कर दिया। यह AI मॉडल्स को एक-दूसरे से बहुत अधिक कुशलता से सीखने की अनुमति देता है, जिससे कम समय और कम कंप्यूटर पावर में बेहतर परिणाम मिलते हैं।
नोट: पेपर ने विशेष रूप से Qwen3 मॉडल्स का उपयोग करके गणितीय तर्क कार्यों पर इसका परीक्षण किया है। यह दावा नहीं करता है कि ये परिणाम चिकित्सा निदान, रचनात्मक लेखन या अन्य विशिष्ट वास्तविक दुनिया के अनुप्रयोगों पर लागू होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।