Weak-to-Strong Generalization via Direct On-Policy Distillation
यह शोध पत्र डायरेक्ट ऑन-पॉलिसी डिस्टिलेशन (Direct-OPD) का प्रस्ताव करता है, जो एक ऐसी विधि है जो वेरिफिएबल रिवॉर्ड्स (RLVR) के साथ सुदृढीकरण सीखने (reinforcement learning) के दौरान एक छोटे मॉडल द्वारा सीखे गए पॉलिसी शिफ्ट्स को शिक्षक के प्री- और पोस्ट-RL पॉलिसियों के लॉग-अनुपात (log-ratio) को एक डेंस इम्प्लिसिट रिवॉर्ड के रूप में उपयोग करके एक मजबूत लक्ष्य मॉडल में स्थानांतरित करती है, जिससे बड़े मॉडल पर पूर्ण RL चलाने की उच्च कम्प्यूटेशनल लागत के बिना कुशल वीक-टू-स्ट्रोंग जनरलाइजेशन सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ शोध पत्र "Weak-to-Strong Generalization via Direct On-Policy Distillation" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।
बड़ी समस्या: दिग्गजों को प्रशिक्षित करना महंगा है
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत धीमे और महंगे प्रोफेसर (एक बड़े AI मॉडल) को जटिल गणित की समस्याएं हल करना सिखाना चाहते हैं। इसे करने का वर्तमान सबसे अच्छा तरीका रीइन्फोर्समेंट लर्निंग (RL) है।
RL में, मॉडल एक समस्या को हल करने की कोशिश करता है, यदि वह सही होता है तो उसे एक स्कोर (एक "रिवॉर्ड") मिलता है, और वह उससे सीखता है। लेकिन यहाँ एक पेंच है: सीखने के लिए, मॉडल को यह देखने के लिए कि क्या काम करता है, हजारों अभ्यास प्रयास ("rollouts") उत्पन्न करने होते हैं।
- बाधा (The Bottleneck): यदि आपका "प्रोफेसर" एक विशाल सुपर-कंप्यूटर है, तो इन अभ्यास प्रयासों को उत्पन्न करने में बहुत समय लगता है और बिजली का भारी खर्च आता है। जैसे-जैसे AI मॉडल बड़े होते जा रहे हैं, यह प्रशिक्षण प्रक्रिया हर नए मॉडल के लिए दोहराने हेतु बहुत धीमी और महंगी होती जा रही है।
प्रस्तावित समाधान: "अपेंटिस" (Apprentice) रणनीति
लेखक एक चतुर शॉर्टकट का प्रस्ताव करते हैं जिसे Direct-OPD कहा जाता है। महंगे दिग्गज (Giant) को सीधे प्रशिक्षित करने के बजाय, वे पहले एक छोटे, सस्ते "अपेंटिस" (Apprentice - प्रशिक्षु) मॉडल को प्रशिक्षित करते हैं, और फिर उस अपेंटिस ने जो सीखा है उसे दिग्गज को स्थानांतरित कर देते हैं।
इसे इस तरह सोचें:
- अपेंटिस (छोटा मॉडल): आप एक जूनियर छात्र को काम पर रखते हैं जिसे प्रशिक्षित करना तेज़ और सस्ता है। आप उन्हें महंगे RL तरीके से सिखाते हैं। वे थोड़ा संघर्ष करते हैं, लेकिन अंततः वे कैसे बेहतर तरीके से सोचना है, यह समझ जाते हैं।
- मास्टर (बड़ा मॉडल): आपके पास एक जीनियस प्रोफेसर है जो पहले से ही बहुत बुद्धिमान है, लेकिन उसने अभी तक यह विशिष्ट नई सोचने की शैली नहीं सीखी है।
- लक्ष्य: आप चाहते हैं कि मास्टर उस सुधार (improvement) को सीख ले जो अपेंटिस ने किया है, बिना मास्टर को महंगे अभ्यास ड्रिल कराने के लिए भुगतान किए।
जाल: केवल अपेंटिस की नकल न करें
एक स्वाभाविक विचार यह होगा कि, "ठीक है, अपेंटिस अब गणित में अच्छा है। चलिए बस मास्टर को अपेंटिस के उत्तरों की नकल करने के लिए कहते हैं।"
शोध पत्र कहता है: ऐसा न करें।
क्यों? क्योंकि अपेंटिस अभी भी एक जूनियर है। उनकी सीमाएं हैं। यदि मास्टर अपेंटिस की नकल करता है, तो मास्टर वास्तव में और खराब हो सकता है क्योंकि वह अपेंटिस की गलतियों और सीमाओं की नकल कर रहा है, न कि केवल उनके सुधारों की।
- उपमा: कल्पना कीजिए कि एक नौसिखिया शतरंज खिलाड़ी जिसने आखिरकार एक विशिष्ट ओपनिंग मूव सीख लिया है जो एक शुरुआती खिलाड़ी को हरा देता है। यदि एक ग्रैंडमास्टर उस नौसिखिए के पूरे खेलने के तरीके की नकल करने की कोशिश करता है, तो ग्रैंडमास्टर हार जाएगा। ग्रैंडमास्टर को केवल उस एक विशिष्ट नए मूव को सीखने की आवश्यकता है, नौसिखिए के पूरे व्यक्तित्व की नहीं।
गुप्त मंत्र: "डायरेक्ट ऑन-पॉलिसी डिस्टिलेशन" (Direct-OPD)
लेखकों ने केवल सुधार को निकालने और सीमाओं को पीछे छोड़ने का एक तरीका आविष्कार किया है।
यह कैसे काम करता है, चरण-दर-चरण:
- पहले और बाद का स्नैपशॉट लें:
- अपेंटिस के मस्तिष्क की प्रशिक्षण से पहले की एक तस्वीर लें (इसे Old Brain कहें)।
- अपेंटिस के मस्तिष्क की प्रशिक्षण के बाद की एक तस्वीर लें (इसे New Brain कहें)।
- अंतर खोजें:
- यह तरीका दोनों मस्तिष्कों की तुलना करता है। यह पूछता है: "नए मस्तिष्क ने ऐसा क्या निर्णय लिया जो पुराने मस्तिष्क ने नहीं लिया होता?"
- यह उस सब चीज़ को अनदेखा कर देता है जिसमें अपेंटिस पहले से ही अच्छा था। यह केवल परिवर्तन (change) को देखता है।
- उपमा: कल्पना कीजिए कि अपेंटिस पहले हमेशा पिज्जा खाता था। प्रशिक्षण के बाद, उसने सलाद खाने का फैसला किया। "परिवर्तन" पिज्जा से सलाद की ओर स्विच करना है। यह तरीका इस तथ्य को अनदेखा करता है कि वह अभी भी खाना बनाने में बुरा है; इसे केवल सलाद के निर्णय की परवाह है।
- मास्टर को सिखाएं:
- मास्टर (बड़े मॉडल) को समस्याएं हल करने के लिए कहा जाता है।
- अपेंटिस के अंतिम उत्तरों की नकल करने के बजाय, मास्टर को अंतर दिखाया जाता है जो पुराने और नए अपेंटिस मस्तिष्क के बीच है।
- मास्टर को बताया जाता है: "जब आप इस स्थिति में हों, तो 'नया' संस्करण अपेंटिस इस रास्ते को चुनता, जबकि 'पुराना' संस्करण ऐसा नहीं करता। इसलिए, आपको उस रास्ते की ओर झुकना चाहिए।"
यह गेम-चेंजर क्यों है
शोध पत्र सिद्ध करता है कि यह तीन अद्भुत तरीकों से काम करता है:
1. यह तब भी काम करता है जब मास्टर अपेंटिस से अधिक स्मार्ट हो।
आमतौर पर, आप अपने से कमजोर व्यक्ति से नहीं सीख सकते। लेकिन यहाँ, मास्टर अपेंटिस के उत्तरों से नहीं सीख रहा है; वह उस दिशा से सीख रहा है जिस ओर अपेंटिस आगे बढ़ा है।
- उपमा: भले ही एक ग्रैंडमास्टर एक नौसिखिए से बेहतर हो, लेकिन नौसिखिया एक नया, अजीब सा तरीका खोज सकता है जिसे ग्रैंडमास्टर ने अभी तक आज़माया नहीं है। ग्रैंडमास्टर उस ट्रिक को अपना सकता है बिना नौसिखिया बने।
2. यह अविश्वसनीय रूप से सस्ता और तेज़ है।
छोटे अपेंटिस को प्रशिक्षित करने में कुछ कंप्यूटरों पर कुछ घंटे लगते हैं। उस "परिवर्तन" को बड़े मॉडल में स्थानांतरित करने में केवल कुछ और घंटे लगते हैं।
- परिणाम: शोध पत्र दिखाता है कि उन्होंने केवल 4 घंटों में 8 कंप्यूटरों पर एक मॉडल के गणित स्कोर को 48% से बढ़ाकर 58% कर दिया। बड़े मॉडल पर इसे सीधे करने में हफ्तों लग जाते और 32 कंप्यूटरों की आवश्यकता होती।
3. आप इन्हें स्टैक (Stack) कर सकते हैं।
आप एक छोटा अपेंटिस प्रशिक्षित कर सकते हैं, सबक स्थानांतरित कर सकते हैं, फिर एक अलग छोटा अपेंटिस किसी अन्य कौशल पर प्रशिक्षित कर सकते हैं, और उसे भी स्थानांतरित कर सकते हैं। यह मास्टर मॉडल पर अलग-अलग "स्किल पैच" लगाने जैसा है।
सारांश
यह शोध पत्र Direct-OPD पेश करता है, एक ऐसी विधि जो एक छोटे AI मॉडल के प्रशिक्षण प्रक्रिया को कॉपी करने योग्य अंतिम उत्पाद के रूप में नहीं, बल्कि सुधारों के मानचित्र (map of improvements) के रूप में देखती है।
एक विशाल AI को छोटे AI के अंतिम उत्तरों की नकल करने के लिए मजबूर करने के बजाय (जो कि एक डाउनग्रेड होगा), यह विधि "डेल्टा" (delta) को निकालती है—वे विशिष्ट परिवर्तन जो छोटे AI ने बेहतर होने के लिए किए थे—और उन परिवर्तनों को बड़े AI पर लागू करती है। यह हमें छोटे, तेज़ प्रशिक्षण का उपयोग करके विशाल, महंगे मॉडलों को अपग्रेड करने की अनुमति देता है, जिससे प्रदर्शन को बढ़ाते हुए समय और पैसे की बचत होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।