← नवीनतम पेपर
🤖 machine learning

PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation

PowerOPD अनबाउंडेड (unbounded) लॉग-रेशियो रिवॉर्ड के स्थान पर बॉक्स-कॉक्स पावर ट्रांसफॉर्मेशन से व्युत्पन्न स्वाभाविक रूप से बाउंडेड और साइन-कंसिस्टेंट (sign-consistent) रिवॉर्ड्स के एक परिवार को प्रतिस्थापित करके मानक ऑन-पॉलिसी डिस्टिलेशन की गंभीर प्रशिक्षण अस्थिरता और सैंपल अक्षमता को संबोधित करता है, जिससे कई रीजनिंग बेंचमार्क और मॉडल पेयर्स में बेहतर प्रदर्शन और दक्षता प्राप्त होती है।

मूल लेखक: Anhao Zhao, Junlong Tong, Yingqi Fan, Ping Nie, Wenjie Li, Xiaoyu Shen

प्रकाशित 2026-06-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anhao Zhao, Junlong Tong, Yingqi Fan, Ping Nie, Wenjie Li, Xiaoyu Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन प्रशिक्षु (Student) को एक कुशल शिल्पकार (Teacher) को देखते हुए लिखना सिखाने की कोशिश कर रहे हैं।

लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया में, इस प्रक्रिया को On-Policy Distillation कहा जाता है। लक्ष्य यह है कि प्रशिक्षु अपने स्वयं के ड्राफ्ट पर अभ्यास करते हुए शिक्षक की शैली से सीख सके।

समस्या: "चिल्लाने वाला" शिक्षक

मानक तरीका (जिसे Vanilla OPD कहा जाता है) इस प्रकार काम करता है: हर बार जब प्रशिक्षु एक शब्द लिखता है, तो शिक्षक उसकी तुलना उस शब्द से करता है जो वे लिखते।

  • यदि प्रशिक्षु एक ऐसा शब्द चुनता है जिसे शिक्षक पसंद करता है, तो शिक्षक उच्च स्कोर देता है।
  • यदि प्रशिक्षु एक अजीब शब्द चुनता है जिसे शिक्षक नापसंद करता है, तो वह कम स्कोर देता है।

खामी: पेपर का तर्क है कि मानक तरीकों में उपयोग किया जाने वाला "स्कोरिंग सिस्टम" टूटा हुआ है। यह ऐसा है जैसे एक शिक्षक जो कोमल "0 से 10" का स्कोर देने के बजाय, एक लॉगरिदमिक स्केल का उपयोग करता है जो -50 से +50 तक बेतहाशा बदल सकता है।

  • "दुर्लभ टोकन" का जाल (The "Rare Token" Trap): यदि प्रशिक्षु एक बहुत ही दुर्लभ शब्द चुनता है जिसे शिक्षक नापसंद करता है, तो स्कोर गिरकर -50 हो जाता है। यह एकल, दुर्लभ गलती एक विशाल, चिल्लाता हुआ संकेत भेजती है जो पूरे पाठ (lesson) को दबा देता है।
  • शुरुआती गलती: ये चिल्लाते हुए स्कोर ज्यादातर वाक्य के शुरुआत में होते हैं। यदि प्रशिक्षु पहला शब्द गलत चुन लेता है, तो शिक्षक की घबराहट वाली प्रतिक्रिया पूरे वाक्य को बर्बाद कर देती है, जिससे प्रशिक्षु भ्रम के चक्रव्यूह में फंस जाता है।
  • परिणाम: प्रशिक्षु भ्रमित हो जाता है, प्रशिक्षण में बहुत समय लगता है, और वे कभी भी मास्टर के स्तर तक नहीं पहुँच पाते।

लेखकों ने इसे "क्लिपिंग" (शिक्षक को शांत रहने के लिए कहना) या "नॉर्मलाइजिंग" (औसत निकालना) करके ठीक करने की कोशिश की, लेकिन ये एक टूटी हुई टांग पर पट्टी लगाने जैसे थे। अंतर्निहित गणित अभी भी त्रुटिपूर्ण था।

समाधान: PowerOPD (एक "सीमित" शिक्षक)

लेखक PowerOPD नामक एक नई विधि प्रस्तावित करते हैं। एक चिल्लाते हुए, असीमित स्केल के बजाय, वे एक बाउंडेड (bounded) स्कोरिंग सिस्टम बनाने के लिए एक गणितीय ट्रिक (जिसे Box-Cox transformation कहा जाता है) का उपयोग करते हैं।

इसे इस प्रकार समझें:

  • पुरानी विधि: शिक्षक की आवाज़ एक माइक्रोफ़ोन की तरह है जिसकी कोई वॉल्यूम सीमा नहीं है। यदि छात्र एक छोटी सी गलती करता है, तो शिक्षक इतना ज़ोर से चिल्लाता है कि छात्र के कान टूट जाते हैं।
  • PowerOPD: शिक्षक की आवाज़ एक सुरक्षित, अधिकतम वॉल्यूम पर सीमित है। भले ही छात्र एक भयानक गलती करे, शिक्षक कहता है, "यह बुरा है," लेकिन वॉल्यूम कभी भी एक सुरक्षित सीमा से ऊपर नहीं जाता है।

इस नए सिस्टम के पास दो महाशक्तियाँ हैं:

  1. यह बाउंडेड (Bounded) है: स्कोर कभी पागल नहीं हो सकते। वे एक सुरक्षित सीमा (जैसे -1 से +1) के भीतर रहते हैं।
  2. यह सुसंगत (Consistent) है: यह हमेशा सही दिशा दिखाता है। यदि शिक्षक को शब्द पसंद आता है, तो स्कोर सकारात्मक होता है; यदि वे उसे नापसंद करते हैं, तो यह नकारात्मक होता है। यह कभी भी यह समझने में भ्रमित नहीं होता कि छात्र को किस दिशा में धकेलना है।

परिणाम: स्मार्ट, तेज़ और शांत

पेपर ने विभिन्न आकार के AI मॉडल्स का उपयोग करके गणित की समस्याओं पर इस नई विधि का परीक्षण किया। यहाँ हुआ:

  • बेहतर ग्रेड: प्रशिक्षु बहुत तेज़ी से सीखा और गणित की समस्याओं को हल करने में काफी बेहतर हुआ (औसतन 6.37% अधिक सटीकता)।
  • छोटे, स्पष्ट उत्तर: पुरानी विधि ने प्रशिक्षु को बहुत लंबा लिखने के लिए प्रेरित किया, जिससे वे अक्सर अधिकतम लंबाई की सीमा तक पहुँच जाते थे। PowerOPD ने प्रशिक्षु को संक्षिप्त होना सिखाया, जिससे वे छोटे और सीधे उत्तर देते हैं।
  • सस्ता प्रशिक्षण: क्योंकि प्रशिक्षण बहुत अधिक स्थिर था, इसलिए इसे लंबे समय तक चलाने की आवश्यकता नहीं थी। इसने पुराने तरीके के सबसे महंगे संस्करण की तुलना में 59% समय और 23% कंप्यूटर मेमोरी बचाई।
  • "अल्फा" नॉब (The "Alpha" Knob): इस विधि में एक सेटिंग है जिसे Alpha (α) कहा जाता है। इस नॉब को ऊपर घुमाने से शिक्षक और भी अधिक केंद्रित हो जाता है। उच्च अल्फा मानों ने प्रशिक्षु को तेज़ी से सीखने, छोटे उत्तर देने और प्रशिक्षण प्रक्रिया को अविश्वसनीय रूप से सुचारू बनाए रखने में मदद की (ग्रेडिएंट शोर 3,000 गुना कम हो गया)।

निष्कर्ष

पेपर का दावा है कि AI मॉडल्स को सिखाने का पुराना तरीका इसलिए टूटा हुआ था क्योंकि "रिवॉर्ड्स" (स्कोर) बहुत अनियंत्रित और बेतहाशा थे। एक नए, गणितीय रूप से "बाउंडेड" स्कोरिंग सिस्टम में स्विच करके, उन्होंने अस्थिरता को ठीक कर दिया। यह AI मॉडल्स को एक-दूसरे से बहुत अधिक कुशलता से सीखने की अनुमति देता है, जिससे कम समय और कम कंप्यूटर पावर में बेहतर परिणाम मिलते हैं।

नोट: पेपर ने विशेष रूप से Qwen3 मॉडल्स का उपयोग करके गणितीय तर्क कार्यों पर इसका परीक्षण किया है। यह दावा नहीं करता है कि ये परिणाम चिकित्सा निदान, रचनात्मक लेखन या अन्य विशिष्ट वास्तविक दुनिया के अनुप्रयोगों पर लागू होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →