← नवीनतम पेपर
💬 NLP

Weak-to-Strong Generalization via Direct On-Policy Distillation

यह शोध पत्र डायरेक्ट ऑन-पॉलिसी डिस्टिलेशन (Direct-OPD) का प्रस्ताव करता है, जो एक ऐसी विधि है जो वेरिफिएबल रिवॉर्ड्स (RLVR) के साथ सुदृढीकरण सीखने (reinforcement learning) के दौरान एक छोटे मॉडल द्वारा सीखे गए पॉलिसी शिफ्ट्स को शिक्षक के प्री- और पोस्ट-RL पॉलिसियों के लॉग-अनुपात (log-ratio) को एक डेंस इम्प्लिसिट रिवॉर्ड के रूप में उपयोग करके एक मजबूत लक्ष्य मॉडल में स्थानांतरित करती है, जिससे बड़े मॉडल पर पूर्ण RL चलाने की उच्च कम्प्यूटेशनल लागत के बिना कुशल वीक-टू-स्ट्रोंग जनरलाइजेशन सक्षम होता है।

मूल लेखक: Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

प्रकाशित 2026-07-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Weak-to-Strong Generalization via Direct On-Policy Distillation" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: दिग्गजों को प्रशिक्षित करना महंगा है

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत धीमे और महंगे प्रोफेसर (एक बड़े AI मॉडल) को जटिल गणित की समस्याएं हल करना सिखाना चाहते हैं। इसे करने का वर्तमान सबसे अच्छा तरीका रीइन्फोर्समेंट लर्निंग (RL) है।

RL में, मॉडल एक समस्या को हल करने की कोशिश करता है, यदि वह सही होता है तो उसे एक स्कोर (एक "रिवॉर्ड") मिलता है, और वह उससे सीखता है। लेकिन यहाँ एक पेंच है: सीखने के लिए, मॉडल को यह देखने के लिए कि क्या काम करता है, हजारों अभ्यास प्रयास ("rollouts") उत्पन्न करने होते हैं।

  • बाधा (The Bottleneck): यदि आपका "प्रोफेसर" एक विशाल सुपर-कंप्यूटर है, तो इन अभ्यास प्रयासों को उत्पन्न करने में बहुत समय लगता है और बिजली का भारी खर्च आता है। जैसे-जैसे AI मॉडल बड़े होते जा रहे हैं, यह प्रशिक्षण प्रक्रिया हर नए मॉडल के लिए दोहराने हेतु बहुत धीमी और महंगी होती जा रही है।

प्रस्तावित समाधान: "अपेंटिस" (Apprentice) रणनीति

लेखक एक चतुर शॉर्टकट का प्रस्ताव करते हैं जिसे Direct-OPD कहा जाता है। महंगे दिग्गज (Giant) को सीधे प्रशिक्षित करने के बजाय, वे पहले एक छोटे, सस्ते "अपेंटिस" (Apprentice - प्रशिक्षु) मॉडल को प्रशिक्षित करते हैं, और फिर उस अपेंटिस ने जो सीखा है उसे दिग्गज को स्थानांतरित कर देते हैं।

इसे इस तरह सोचें:

  1. अपेंटिस (छोटा मॉडल): आप एक जूनियर छात्र को काम पर रखते हैं जिसे प्रशिक्षित करना तेज़ और सस्ता है। आप उन्हें महंगे RL तरीके से सिखाते हैं। वे थोड़ा संघर्ष करते हैं, लेकिन अंततः वे कैसे बेहतर तरीके से सोचना है, यह समझ जाते हैं।
  2. मास्टर (बड़ा मॉडल): आपके पास एक जीनियस प्रोफेसर है जो पहले से ही बहुत बुद्धिमान है, लेकिन उसने अभी तक यह विशिष्ट नई सोचने की शैली नहीं सीखी है।
  3. लक्ष्य: आप चाहते हैं कि मास्टर उस सुधार (improvement) को सीख ले जो अपेंटिस ने किया है, बिना मास्टर को महंगे अभ्यास ड्रिल कराने के लिए भुगतान किए।

जाल: केवल अपेंटिस की नकल न करें

एक स्वाभाविक विचार यह होगा कि, "ठीक है, अपेंटिस अब गणित में अच्छा है। चलिए बस मास्टर को अपेंटिस के उत्तरों की नकल करने के लिए कहते हैं।"

शोध पत्र कहता है: ऐसा न करें।
क्यों? क्योंकि अपेंटिस अभी भी एक जूनियर है। उनकी सीमाएं हैं। यदि मास्टर अपेंटिस की नकल करता है, तो मास्टर वास्तव में और खराब हो सकता है क्योंकि वह अपेंटिस की गलतियों और सीमाओं की नकल कर रहा है, न कि केवल उनके सुधारों की।

  • उपमा: कल्पना कीजिए कि एक नौसिखिया शतरंज खिलाड़ी जिसने आखिरकार एक विशिष्ट ओपनिंग मूव सीख लिया है जो एक शुरुआती खिलाड़ी को हरा देता है। यदि एक ग्रैंडमास्टर उस नौसिखिए के पूरे खेलने के तरीके की नकल करने की कोशिश करता है, तो ग्रैंडमास्टर हार जाएगा। ग्रैंडमास्टर को केवल उस एक विशिष्ट नए मूव को सीखने की आवश्यकता है, नौसिखिए के पूरे व्यक्तित्व की नहीं।

गुप्त मंत्र: "डायरेक्ट ऑन-पॉलिसी डिस्टिलेशन" (Direct-OPD)

लेखकों ने केवल सुधार को निकालने और सीमाओं को पीछे छोड़ने का एक तरीका आविष्कार किया है।

यह कैसे काम करता है, चरण-दर-चरण:

  1. पहले और बाद का स्नैपशॉट लें:
    • अपेंटिस के मस्तिष्क की प्रशिक्षण से पहले की एक तस्वीर लें (इसे Old Brain कहें)।
    • अपेंटिस के मस्तिष्क की प्रशिक्षण के बाद की एक तस्वीर लें (इसे New Brain कहें)।
  2. अंतर खोजें:
    • यह तरीका दोनों मस्तिष्कों की तुलना करता है। यह पूछता है: "नए मस्तिष्क ने ऐसा क्या निर्णय लिया जो पुराने मस्तिष्क ने नहीं लिया होता?"
    • यह उस सब चीज़ को अनदेखा कर देता है जिसमें अपेंटिस पहले से ही अच्छा था। यह केवल परिवर्तन (change) को देखता है।
    • उपमा: कल्पना कीजिए कि अपेंटिस पहले हमेशा पिज्जा खाता था। प्रशिक्षण के बाद, उसने सलाद खाने का फैसला किया। "परिवर्तन" पिज्जा से सलाद की ओर स्विच करना है। यह तरीका इस तथ्य को अनदेखा करता है कि वह अभी भी खाना बनाने में बुरा है; इसे केवल सलाद के निर्णय की परवाह है।
  3. मास्टर को सिखाएं:
    • मास्टर (बड़े मॉडल) को समस्याएं हल करने के लिए कहा जाता है।
    • अपेंटिस के अंतिम उत्तरों की नकल करने के बजाय, मास्टर को अंतर दिखाया जाता है जो पुराने और नए अपेंटिस मस्तिष्क के बीच है।
    • मास्टर को बताया जाता है: "जब आप इस स्थिति में हों, तो 'नया' संस्करण अपेंटिस इस रास्ते को चुनता, जबकि 'पुराना' संस्करण ऐसा नहीं करता। इसलिए, आपको उस रास्ते की ओर झुकना चाहिए।"

यह गेम-चेंजर क्यों है

शोध पत्र सिद्ध करता है कि यह तीन अद्भुत तरीकों से काम करता है:

1. यह तब भी काम करता है जब मास्टर अपेंटिस से अधिक स्मार्ट हो।
आमतौर पर, आप अपने से कमजोर व्यक्ति से नहीं सीख सकते। लेकिन यहाँ, मास्टर अपेंटिस के उत्तरों से नहीं सीख रहा है; वह उस दिशा से सीख रहा है जिस ओर अपेंटिस आगे बढ़ा है।

  • उपमा: भले ही एक ग्रैंडमास्टर एक नौसिखिए से बेहतर हो, लेकिन नौसिखिया एक नया, अजीब सा तरीका खोज सकता है जिसे ग्रैंडमास्टर ने अभी तक आज़माया नहीं है। ग्रैंडमास्टर उस ट्रिक को अपना सकता है बिना नौसिखिया बने।

2. यह अविश्वसनीय रूप से सस्ता और तेज़ है।
छोटे अपेंटिस को प्रशिक्षित करने में कुछ कंप्यूटरों पर कुछ घंटे लगते हैं। उस "परिवर्तन" को बड़े मॉडल में स्थानांतरित करने में केवल कुछ और घंटे लगते हैं।

  • परिणाम: शोध पत्र दिखाता है कि उन्होंने केवल 4 घंटों में 8 कंप्यूटरों पर एक मॉडल के गणित स्कोर को 48% से बढ़ाकर 58% कर दिया। बड़े मॉडल पर इसे सीधे करने में हफ्तों लग जाते और 32 कंप्यूटरों की आवश्यकता होती।

3. आप इन्हें स्टैक (Stack) कर सकते हैं।
आप एक छोटा अपेंटिस प्रशिक्षित कर सकते हैं, सबक स्थानांतरित कर सकते हैं, फिर एक अलग छोटा अपेंटिस किसी अन्य कौशल पर प्रशिक्षित कर सकते हैं, और उसे भी स्थानांतरित कर सकते हैं। यह मास्टर मॉडल पर अलग-अलग "स्किल पैच" लगाने जैसा है।

सारांश

यह शोध पत्र Direct-OPD पेश करता है, एक ऐसी विधि जो एक छोटे AI मॉडल के प्रशिक्षण प्रक्रिया को कॉपी करने योग्य अंतिम उत्पाद के रूप में नहीं, बल्कि सुधारों के मानचित्र (map of improvements) के रूप में देखती है।

एक विशाल AI को छोटे AI के अंतिम उत्तरों की नकल करने के लिए मजबूर करने के बजाय (जो कि एक डाउनग्रेड होगा), यह विधि "डेल्टा" (delta) को निकालती है—वे विशिष्ट परिवर्तन जो छोटे AI ने बेहतर होने के लिए किए थे—और उन परिवर्तनों को बड़े AI पर लागू करती है। यह हमें छोटे, तेज़ प्रशिक्षण का उपयोग करके विशाल, महंगे मॉडलों को अपग्रेड करने की अनुमति देता है, जिससे प्रदर्शन को बढ़ाते हुए समय और पैसे की बचत होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →