← नवीनतम पेपर
🤖 machine learning

On the Geometry of On-Policy Distillation

यह शोध पत्र ऑन-पॉलिसी डिस्टिलेशन (OPD) की प्रशिक्षण गतिशीलता को एक विशिष्ट ज्यामितीय शासन के रूप में अभिलक्षित करता है जो सुपरवाइज्ड फाइन-ट्यूनिंग और सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) से भिन्न है, यह प्रकट करते हुए कि OPD अपडेट तेजी से एक विशिष्ट निम्न-आयामी उप-स्थान (लो-डायमेंशनल सबस्पेस) में लॉक हो जाते हैं जो इसके प्रदर्शन के लिए कार्यात्मक रूप से पर्याप्त है।

मूल लेखक: Zhennan Shen, Yanshu Li, Qingyu Yin, Chak Tou Leong, Zhilin Wang, Yanxu Chen, Rongduo Han, Sunbowen Lee, Yi R. Fung

प्रकाशित 2026-06-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhennan Shen, Yanshu Li, Qingyu Yin, Chak Tou Leong, Zhilin Wang, Yanxu Chen, Rongduo Han, Sunbowen Lee, Yi R. Fung

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र (एक बड़े AI मॉडल) को जटिल गणितीय समस्याओं को हल करना सिखाने की कोशिश कर रहे हैं। आपके पास इसे करने के तीन मुख्य तरीके हैं, और यह शोध पत्र एक जासूसी कहानी की तरह है जो यह पता लगा रहा है कि प्रत्येक विधि के दौरान छात्र के "मस्तिष्क" में वास्तव में क्या बदलाव आते हैं।

तीन विधियाँ हैं:

  1. SFT (Supervised Fine-Tuning): शिक्षक छात्र को सटीक उत्तरों की एक पाठ्यपुस्तक देता है, और छात्र उन्हें रट लेता है।
  2. RLVR (Reinforcement Learning): छात्र अपने आप समस्याओं को हल करने की कोशिश करता है, अंत में उसे केवल एक सरल "सही!" या "गलत!" मिलता है, और वह परिणाम से सीखता है।
  3. OPD (On-Policy Distillation): यह नई और दिलचस्प विधि है। छात्र समस्याओं को हल करने की कोशिश करता है, लेकिन एक बहुत ही बुद्धिमान शिक्षक छात्र के हर एक कदम पर नज़र रखता है, और यदि छात्र थोड़ा भी भटकता है, तो उसे तुरंत सुधारता है।

यह शोध पत्र पूछता है: जब हम इस नई OPD विधि का उपयोग करते हैं, तो छात्र के "मस्तिष्क" (इसके गणितीय भार/weights) के अंदर क्या होता है?

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) के माध्यम से विवरण दिया गया है:

1. "रिलैक्स्ड ऑफ-प्रिंसिपल" (Relaxed Off-Principal) ज़ोन

कल्पना कीजिए कि छात्र का मस्तिष्क एक विशाल, बहु-आयामी परिदृश्य (landscape) है।

  • SFT एक बुलडोजर की तरह है। यह परिदृश्य के माध्यम से रास्ता बनाता है, लगभग सब कुछ बदल देता है, और एक सीधी, अनुमानित रेखा में चलता है। यह बहुत शक्तिशाली है और मस्तिष्क के "मुख्य रास्तों" (principal directions) को बदल देता है।
  • RLVR एक निंजा की तरह है। यह केवल शांत, छिपी हुई गलियों (off-principal directions) में बहुत सूक्ष्म और सटीक बदलाव करता है, मुख्य रास्तों को अछूता छोड़ देता है।
  • OPD एक कुशल हाइकर (पगडंडी पर चलने वाला) की तरह है। यह बुलडोजर की तरह परिदृश्य को नष्ट नहीं करता, लेकिन यह निंजा की तरह चुपचाप भी नहीं घूमता। यह एक बीच का रास्ता अपनाता है: यह बुलडोजर की तुलना में कम चीज़ों को बदलता है, लेकिन यह निंजा की तुलना में अधिक सक्रिय है। यह उन मुख्य रास्तों से बचता है लेकिन निंजा की तरह बहुत अधिक सीमित भी नहीं है।

2. "सबस्पेस लॉक" (The Subspace Lock - गुप्त सुरंग)

यह इस शोध पत्र की सबसे बड़ी खोज है।

  • जब बुलडोजर (SFT) काम करता है, तो यह अपने पथ का विस्तार करता रहता है, पूरे प्रशिक्षण के दौरान मस्तिष्क के नए और व्यापक क्षेत्रों की खोज करता है।
  • जब निंजा (RLVR) काम करता है, तो यह व्यापक रूप से शुरू होता है लेकिन अंततः एक बहुत ही विशिष्ट, छोटे स्थान तक सिमट जाता है।
  • जब हाइकर (OPD) शुरू होता है, तो वह जल्दी से एक संकरी, गुप्त सुरंग (एक लो-डायमेंशनल चैनल) ढूंढ लेता है और अपनी पूरी यात्रा के दौरान उसी के भीतर रहता है।

"अहा!" क्षण (The "Aha!" Moment): शोधकर्ताओं ने परीक्षण किया कि क्या यह सुरंग केवल एक संयोग थी या यह वास्तव में आवश्यक थी। उन्होंने छात्र को मजबूर किया कि वह केवल उस संकरी सुरंग के भीतर ही सीखे जो प्रशिक्षण के शुरुआती चरण में मिली थी।

  • परिणाम: OPD छात्र ने बहुत अच्छी तरह से सीखा! वह सुरंग पर्याप्त थी।
  • विपरीत स्थिति: जब उन्होंने यह प्रयोग बुलडोजर (SFT) पर किया, तो छात्र बुरी तरह विफल रहा। बुलडोजर को खुले स्थान की आवश्यकता थी; सुरंग उसके लिए बहुत छोटी थी।
  • निष्कर्ष: OPD के पास एक अनूठी "सुपरपावर" है: यह समाधान के लिए सबसे कुशल, संकरी राह को बहुत जल्दी पहचान लेता है और उस पर टिक जाता है।

3. "लॉक" को क्या नियंत्रित करता है?

शोधकर्ताओं ने "क्या होगा अगर" वाले खेल खेले यह देखने के लिए कि हाइकर को सुरंग में रहने के लिए क्या प्रेरित करता है।

  • परिदृश्य बदलना (Runtime): उन्होंने छात्र को कुछ कदम छोड़ने या थोड़े अलग उदाहरणों से सीखने के लिए कहा (off-policy)। परिणाम: हाइकर ने अभी भी वही सुरंग ढूंढी। वह रास्ता सुदृढ़ (robust) है।
  • नियम बदलना (Objective): उन्होंने OPD विधि को RLVR विधि के साथ मिला दिया (पुरस्कार संकेत/reward signal को बदलना)। परिणाम: सुरंग गायब हो गई! हाइकर भटक गया और इधर-उधर घूमने लगा।

मुख्य बात (The Takeaway): वह "लॉक" जो उस कुशल सुरंग में बनाए रखता है, वह इस बात से नहीं है कि छात्र क्या देख रहा है (डेटा) या वह कैसे आगे बढ़ रहा है (रोलआउट)। यह पूरी तरह से इस बात से नियंत्रित होता है कि शिक्षक छात्र को कैसे पुरस्कृत करता है (ऑब्जेक्टिव/लक्ष्य)। यदि आप खेल के नियम बदलते हैं, तो छात्र अपनी इस कुशल सुरंग का उपयोग करना बंद कर देता है।

सारांश

शोध पत्र यह निष्कर्ष निकालता है कि OPD केवल बुलडोजर और निंजा का मिश्रण नहीं है। यह अपनी स्वयं की ज्यामिति (geometry) वाली एक अलग विधि है। यह मस्तिष्क की संरचना में एक संकरी, कुशल "गुप्त सुरंग" को जल्दी से खोज लेता है और वहीं बना रहता है। यह सुरंग मजबूत और कुशल है, लेकिन यह नाजुक भी है: यदि आप प्रशिक्षण के मौलिक नियमों (objective) को बदलते हैं, तो यह सुरंग गायब हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →