← नवीनतम पेपर
💻 computer science

Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models

यह शोध पत्र ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (OPSD) प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जहाँ एक एकल लार्ज लैंग्वेज मॉडल विशेषाधिकार प्राप्त रीजनिंग ट्रेसेस (privileged reasoning traces) का लाभ उठाकर अपनी ही कमजोर पॉलिसी को सुपरवाइज करने के लिए शिक्षक और छात्र दोनों के रूप में कार्य करता है, जिससे पारंपरिक ऑफ-पॉलिसी डिस्टिलेशन और रिइन्फोर्समेंट लर्निंग विधियों की तुलना में बेहतर गणितीय तर्क प्रदर्शन और काफी अधिक टोकन दक्षता प्राप्त होती है।

मूल लेखक: Siyan Zhao, Zhihui Xie, Mengchen Liu, Jing Huang, Guan Pang, Feiyu Chen, Aditya Grover

प्रकाशित 2026-03-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siyan Zhao, Zhihui Xie, Mengchen Liu, Jing Huang, Guan Pang, Feiyu Chen, Aditya Grover

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "On-Policy Self-Distillation for Large Language Models" (OPSD) के पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

मुख्य विचार: उत्तर कुंजी (Answer Key) को देखते हुए खुद को सिखाना

कल्पना कीजिए कि आप एक बहुत कठिन गणित की परीक्षा दे रहे हैं। आप एक सवाल पर अटक गए हैं।

  • पुराना तरीका (Reinforcement Learning/GRPO): आप एक उत्तर का अनुमान लगाते हैं। यदि वह गलत है, तो आपको एक बड़ा लाल "X" मिलता है और आपको फिर से शुरू करना पड़ता है। आपको एक सही उत्तर खोजने के लिए 100 अलग-अलग अनुमान लगाने पड़ सकते हैं। यह अंधेरे में तीर चलाने जैसा है, इस उम्मीद में कि एक भी निशाने पर लगेगा। इसमें बहुत समय और ऊर्जा लगती है।
  • नया तरीका (OPSD): आपको समस्या को हल करते वही उत्तर कुंजी (answer key) देखने की अनुमति है। आप केवल अंतिम संख्या नहीं देखते; आप वह चरण-दर-चरण तर्क (logic) भी देखते हैं जिसका उपयोग शिक्षक ने किया है। आप खुद समस्या हल करने की कोशिश करते हैं, लेकिन हर बार जब आप एक कदम उठाते हैं, तो आप उत्तर कुंजी से जाँचते हैं कि क्या आपका तर्क शिक्षक के तर्क से मेल खाता है। यदि आप पटरी से उतर जाते हैं, तो उत्तर कुंजी आपको धीरे से वापस सही रास्ते पर लाती है।

यह पेपर On-Policy Self-Distillation (OPSD) नामक एक विधि पेश करता है। यह एक तरीका है जिससे एक अकेला AI मॉडल अपनी सोचने की प्रक्रिया को बेहतर बनाने के लिए "उत्तर कुंजी" (सही समाधान) का उपयोग करके खुद को सिखा सकता है।


हमारी कहानी के पात्र

यह समझने के लिए कि यह कैसे काम करता है, आइए कल्पना करें कि AI मॉडल के पास एक ही समय में दो "व्यक्तित्व" या "टोपियाँ" हैं जिन्हें वह पहनता है:

  1. छात्र (The Student - सीखने वाला): AI का यह संस्करण केवल गणित की समस्या देखता है। इसे शून्य से उत्तर ढूंढना होता है, ठीक वैसे ही जैसे एक मानव छात्र। यह गलतियाँ करता है और चरण-दर-चरण समाधान बनाता है।
  2. शिक्षक (The Teacher - मार्गदर्शक): यह बिल्कुल वही AI मॉडल है, लेकिन इसके पास एक गुप्त लाभ है: इसकी जेब में उत्तर कुंजी (सही समाधान और तर्क के चरण) है।

जादुई ट्रिक: शिक्षक वास्तव में नया समाधान नहीं लिखता है। इसके बजाय, वह देखता है कि छात्र ने अभी क्या लिखा है और कहता है, "हे, अगर मेरे पास उत्तर कुंजी होती, तो मैं वहीं से इस तरह आगे बढ़ता जहाँ तुम अभी रुके हो।"

छात्र फिर अपने अगले कदम की तुलना शिक्षक के "आदर्श" अगले कदम से करता है। यदि वे मेल खाते हैं, तो बहुत अच्छा! यदि वे नहीं मिलते, तो छात्र अपने सोचने के तरीके को शिक्षक जैसा बनाने के लिए खुद को ढालना सीखता है।

यह गेम-चेंजर क्यों है

यह पेपर इस नए तरीके की तुलना सीखने के दो मुख्य तरीकों से करता है:

1. "अंधा अनुमान" लगाने की विधि (Reinforcement Learning / GRPO)

  • यह कैसे काम करती है: AI एक समस्या को हल करने की कोशिश करता है। यदि उसे सही उत्तर मिलता है, तो उसे एक इनाम (cookie) मिलता है। यदि वह गलत है, तो उसे कोई इनाम नहीं मिलता।
  • समस्या: AI को कई बार (अक्सर 8 या अधिक) अनुमान लगाना पड़ता है ताकि एक सही उत्तर मिल सके। यह तिजोरी के डायल को तब तक घुमाने जैसा है जब तक कि वह क्लिक न कर दे, बस अंधेरे में हाथ-पैर मारने जैसा। यह धीमा, महंगा और बर्बादी भरा है।
  • OPSD का लाभ: OPSD को 8 बार अनुमान लगाने की आवश्यकता नहीं है। इसे केवल एक प्रयास की आवश्यकता है। क्योंकि इसके पास हर कदम पर मार्गदर्शन करने के लिए उत्तर कुंजी है, यह बहुत तेजी से सीखता है। पेपर कहता है कि यह अनुमान लगाने वाली विधि की तुलना में 8 से 12 गुना अधिक कुशल है।

2. "रटने" की विधि (Supervised Fine-Tuning / SFT)

  • यह कैसे काम करता है: AI को बार-बार समस्या और उसका आदर्श समाधान दिखाया जाता है। यह पैटर्न को रटने की कोशिश करता है।
  • समस्या: यह एक छात्र द्वारा अभ्यास टेस्ट के उत्तर रटने जैसा है लेकिन वास्तविक परीक्षा में असफल होने जैसा, क्योंकि प्रश्न थोड़े अलग होते हैं। AI भ्रमित हो जाता है यदि वह शुरुआत में एक छोटी सी गलती करता है और उसे पता नहीं चलता कि कैसे सुधारा जाए।
  • OPSD का लाभ: OPSD उस छात्र की तरह है जो उत्तर कुंजी देखते हुए काम कर रहा है। यह सीखता है कि गलतियों से कैसे उबरना है और समस्या को कैसे सुलझाना है, न कि केवल अंतिम परिणाम को रटना।

"सेल्फ-डिस्टिलेशन" (Self-Distillation) की अवधारणा

"डिस्टिलेशन" (Distillation) शब्द का अर्थ आमतौर पर एक बड़े, बुद्धिमान शिक्षक से ज्ञान लेकर एक छोटे छात्र में डालना होता है।

इस पेपर में, AI खुद को डिस्टिल (distill) कर रहा है

  • यह अपने "स्मार्ट" पक्ष (शिक्षक जिसके पास उत्तर कुंजी है) का उपयोग अपने "सीखने" वाले पक्ष (छात्र जिसके पास कुंजी नहीं है) को प्रशिक्षित करने के लिए करता है।
  • यह किसी पहेली के समाधान को पढ़ने, किताब बंद करने और फिर उसे फिर से हल करने की कोशिश करने जैसा है, जबकि आप काम करते समय समाधान के साथ अपने काम की जाँच करते हैं। वे खुद को बेहतर सोचने के लिए सिखा रहे हैं।

पेपर के मुख्य निष्कर्ष

  1. आपको एक पर्याप्त स्मार्ट दिमाग चाहिए: यह ट्रिक तभी काम करती है जब AI पहले से ही तर्क करने में काफी अच्छा हो। यदि मॉडल बहुत छोटा या बहुत "मूर्ख" है, तो वह सीखने के लिए उत्तर कुंजी को ठीक से समझ नहीं पाएगा। यह एक बच्चे को टेक्स्टबुक का उपयोग करके कैलकुलस सिखाने जैसा है; बच्चा उसे समझ ही नहीं पाएगा। पेपर ने पाया कि कम से कम 4 बिलियन पैरामीटर्स वाले मॉडल ने अच्छा काम किया, लेकिन एक बहुत छोटा 1.7 बिलियन मॉडल संघर्ष करता रहा।
  2. अधिक चरण = बेहतर सीखना: AI को उत्तर कुंजी की जाँच करते हुए जितना अधिक सोचने (अधिक टोकन जेनरेट करने) की अनुमति दी जाती है, वह उतना ही बेहतर होता जाता है। उसे केवल मंजिल नहीं, बल्कि पूरी यात्रा देखने की आवश्यकता होती है।
  3. यह पैसा बचाता है: क्योंकि यह तेजी से सीखता है और इसे प्रशिक्षित करने के लिए कम कंप्यूटर चक्रों (cycles) की आवश्यकता होती है, इसलिए कंपनियों के लिए उपयोग करने में यह विधि वर्तमान "अनुमान लगाने" वाली विधियों की तुलना में बहुत सस्ती है।

निचोड़ (The Bottom Line)

यह पेपर AI को गणित और तर्क में अच्छा बनाने के लिए एक स्मार्ट और तेज़ तरीका प्रस्तावित करता है। AI को अंधेरे में भाग्य के भरोसे हाथ-पैर मारने देने या केवल उत्तर रटने के लिए मजबूर करने के बजाय, OPSD को एक हाथ में उत्तर कुंजी पकड़कर समस्या हल करने का अभ्यास करने देता है।

यह इनके बीच का अंतर है:

  • पुराना तरीका: "100 बार कोशिश करो जब तक कि तुम सही न हो जाओ।"
  • नया तरीका: "एक बार कोशिश करो, लेकिन हर एक कदम पर समाधान के विरुद्ध अपने काम की जाँच करो।"

परिणाम? एक ऐसा AI जो बेहतर, तेज़ और कम कंप्यूटिंग पावर के साथ तर्क करना सीखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →