Hybrid Policy Distillation for LLMs
यह शोध पत्र हाइब्रिड पॉलिसी डिस्टिलेशन (HPD) को प्रस्तुत करता है, जो एक एकीकृत नॉलेज डिस्टिलेशन फ्रेमवर्क है जो विविध कार्यों में लार्ज लैंग्वेज मॉडल्स को कंप्रेस करने की स्थिरता, दक्षता और प्रदर्शन को बढ़ाने के लिए ऑफ-पॉलिसी और एप्रोक्सिमेट ऑन-पॉलिसी डेटा के मिश्रण के साथ फॉरवर्ड और रिवर्स KL डाइवर्जेंस को एकीकृत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार, विश्व स्तरीय शेफ (शिक्षक) है जो अविश्वसनीय, जटिल व्यंजन बना सकता है। हालाँकि, यह शेफ बहुत विशाल है, उसे खिलाना महंगा है और वह एक बहुत बड़ी रसोई घेर लेता है। आप एक युवा, छोटे प्रशिक्षु (छात्र) को बिल्कुल उसी तरह खाना बनाना सिखाना चाहते हैं, लेकिन आप उस बड़े शेफ को हमेशा के लिए अपने पास नहीं रख सकते।
यह नॉलेज डिस्टिलेशन (Knowledge Distillation) की समस्या है: एक बड़े मॉडल से एक छोटे AI मॉडल को सिखाना।
"हाइब्रिड पॉलिसी डिस्टिलेशन" (Hybrid Policy Distillation) नामक शोध पत्र इस प्रशिक्षु को प्रशिक्षित करने का एक नया, स्मार्ट तरीका प्रस्तावित करता है। यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है:
समस्या: "एक ही आकार सबके लिए" वाली गलती
परंपरागत रूप से, प्रशिक्षु को सिखाने के दो मुख्य तरीके रहे हैं, और दोनों में कमियां हैं:
"नकलची" विधि (Forward KL):
- यह कैसे काम करती है: शिक्षक कहता है, "मैंने एक व्यंजन बनाया जिसमें 30% संभावना तीखे होने की, 20% नमकीन होने की और 50% मीठे होने की थी। तुम्हें उन सभी संभावनाओं से मेल खाना होगा जिन पर मैंने विचार किया था।"
- दोष: प्रशिक्षु भ्रमित हो जाता है। शिक्षक की "सब कुछ संभव है" वाली वाइब से मेल खाने के चक्कर में, छात्र अंततः उबाऊ, बेस्वाद भोजन बनाने लगता है जो एक साथ सब कुछ बनने की कोशिश करता है। यह अत्यधिक सुस्त (over-smoothed) है और इसमें स्वाद की कमी है।
"नखरेबाज" विधि (Reverse KL):
- यह कैसे काम करती है: शिक्षक कहता है, "मुझे केवल सर्वश्रेष्ठ 5 व्यंजन पसंद हैं। बाकी सबको भूल जाओ। बस उन्हीं 5 को बनाओ।"
- दोष: प्रशिक्षु बहुत संकीर्ण हो जाता है। यदि शिक्षक कोई गलती करता है या यदि छात्र गलत अनुमान लगाता है, तो छात्र उन्हीं कुछ व्यंजनों को बार-बार बनाने के लूप में फंस जाता है, जिससे वह अन्य वैध विकल्पों को अनदेखा कर देता है। यह अस्थिर (unstable) है और बुरी आदतें पैदा कर सकता है।
समाधान: हाइब्रिड पॉलिसी डिस्टिलेशन (HPD)
लेखकों ने महसूस किया कि आपको "नकलची" या "नखरेबाज" में से किसी एक को चुनने की आवश्यकता नहीं है। आप स्थिति के आधार पर दोनों हो सकते हैं। वे इसे हाइब्रिड पॉलिसी डिस्टिलेशन (HPD) कहते हैं।
HPD को एक स्मार्ट कोच के रूप में सोचें जो छात्र को मार्गदर्शन देने के लिए एक विशेष "ट्रैफिक लाइट" प्रणाली का उपयोग करता है:
1. "ग्रीन लाइट" (जब छात्र ठीक कर रहा हो)
जब छात्र एक सही उत्तर (एक "एक्सपर्ट टोकन") को देखता है और महसूस करता है, "ओह, मैंने इस उत्तर को पर्याप्त श्रेय नहीं दिया!" (उसने इसका कम आकलन किया था), तो कोच कहता है:
- "जाओ, कोशिश करो!"
- छात्र को शिक्षक की पूरी रेसिपी से सीखने के लिए प्रोत्साहित किया जाता है (Forward KL)। यह सुनिश्चित करता है कि छात्र अच्छी संभावनाओं को मिस न करे।
2. "रेड लाइट" (जब छात्र पटरी से उतर रहा हो)
जब छात्र एक अजीब, बेतुका उत्तर (एक "नॉन-एक्सपर्ट टोकन") देने की कोशिश करता है और महसूस करता है, "रुको, शिक्षक की तुलना में यह समझ में नहीं आ रहा!", तो कोच कहता है:
- "रुको! ऐसा मत करो।"
- छात्र को इस गलत अनुमान के लिए दंडित किया जाता है। लेकिन जादू यहाँ है: केवल "ना" कहने के बजाय, कोच उस ऊर्जा को लेता है और उसे सही उत्तर की ओर मोड़ (redirect) देता है। यह वैसा ही है जैसे गलत मोड़ लेना और उस गति (momentum) का उपयोग खुद को सही रास्ते पर धकेलने के लिए करना।
3. "हल्का अभ्यास" (Lightweight Practice)
आमतौर पर, छात्र को अच्छी तरह सिखाने के लिए, आपको उन्हें पूरे वाक्य (rollouts) उत्पन्न करने का अभ्यास कराना होता है और फिर ग्रेड देना होता है। यह धीमा और महंगा है (जैसे छात्र को प्याज काटने के लिए सिखाने के लिए उसे पूरा 5-कोर्स मील बनाने के लिए कहना)।
HPD चतुर है क्योंकि यह केवल छात्र को अगला शब्द अनुमान लगाने और यह जाँचने के लिए कहता है कि वह सही है या गलत। यह पूरे भोजन के बजाय एक त्वरित "पॉप क्विज़" की तरह है। इससे समय और कंप्यूटर पावर की भारी बचत होती है।
यह एक बड़ी बात क्यों है?
शोध पत्र ने इसे तीन बहुत अलग "रसोईघरों" पर परखा:
- गणितीय तर्क (Math Reasoning): जटिल, लंबे गणितीय समस्याओं को हल करना।
- चैटिंग (Chatting): स्वाभाविक, बहु-चरण बातचीत करना।
- कोडिंग (Coding): कंप्यूटर कोड लिखना।
परिणाम:
- स्थिरता (Stability): छात्र भ्रमित नहीं हुआ या क्रैश नहीं हुआ (कोई "एंट्रॉपी कोलैप्स" नहीं)।
- गति (Speed): इसने पिछले तरीकों की तुलना में बहुत तेज़ी से और सस्ते में प्रशिक्षण दिया।
- प्रदर्शन (Performance): छोटे छात्र मॉडल अंततः विशाल शिक्षक मॉडलों के लगभग समान प्रदर्शन करने में सक्षम रहे, यहाँ तक कि गणित और कोडिंग जैसे कठिन कार्यों में भी।
निचोड़ (The Bottom Line)
हाइब्रिड पॉलिसी डिस्टिलेशन एक छात्र को स्मार्ट, अनुकूलन योग्य ट्यूटर देने जैसा है।
- यदि छात्र अनिश्चित है, तो ट्यूटर उसे संभावनाओं की पूरी रेंज दिखाता है ताकि वह कुछ भी मिस न करे।
- यदि छात्र गलती करता है, तो ट्यूटर उसे तीव्रता से सुधारता है और उस सुधार का उपयोग उसे सही उत्तर की ओर धकेलने के लिए करता है।
- और यह यह सब बिना छात्र को हर बार अभ्यास के दौरान पूरा भोजन बनाने के लिए कहे करता है।
यह विशाल AI दिमागों को छोटे, पोर्टेबल दिमागों में बदलने का एक अधिक कुशल, स्थिर और शक्तिशाली तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।