SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
यह शोध पत्र बड़े पैमाने के Mixture-of-Experts (MoE) मॉडलों को प्रीट्रेनिंग के दौरान कंप्रेस करने के लिए स्ट्रक्चर्ड प्रूनिंग और नॉलेज डिस्टिलेशन की व्यवस्थित जांच करता है, यह प्रदर्शित करते हुए कि प्रूनिंग बेहतर इनिशियलाइजेशन प्रदान करती है, क्रमिक कंप्रेशन शेड्यूल्स वन-शॉट विधियों से बेहतर प्रदर्शन करते हैं, और लैंग्वेज मॉडलिंग को मल्टी-टोकन प्रेडिक्शन डिस्टिलेशन के साथ संयोजित करने से काफी छोटे मॉडल में प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास ज्ञान का एक विशाल, अत्यंत तीव्र पुस्तकालय (एक बहुत बड़ा AI मॉडल) है जो चलाने में अविश्वसनीय रूप से महंगा और पढ़ने में धीमा है। आप इसे एक जेब के आकार के संस्करण में सिकोड़ना चाहते हैं जो लगभग सब कुछ जानता हो, बिना उस पुस्तकालय को फिर से शून्य से बनाए।
यह शोध पत्र, जिसका शीर्षक "SlimQwen" है, विशेष रूप से Mixture-of-Experts (MoE) नामक एक विशिष्ट प्रकार के AI आर्किटेक्चर के लिए यह करने का एक मार्गदर्शक (गाइडबुक) है। MoE मॉडल को एक एकल मस्तिष्क के रूप में नहीं, बल्कि विशेषज्ञों की एक विशाल टीम के रूप में सोचें। कुछ गणित के जीनियस हैं, कुछ कोडिंग के जादूगर हैं, और कुछ भाषा विशेषज्ञ हैं। आमतौर पर, किसी भी प्रश्न का उत्तर देने के लिए केवल कुछ ही विशेषज्ञों को बुलाया जाता है।
शोधकर्ताओं ने पूछा: हम विशेषज्ञों की इस विशाल टीम को एक छोटी, तेज़ टीम में कैसे बदल सकते हैं बिना उनकी सामूहिक प्रतिभा को खोए?
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. "पुरानी कार" बनाम "शून्य से निर्माण" की उपमा
प्रश्न: क्या एक बड़ी, थोड़ी संशोधित कार खरीदना (एक बड़े मॉडल को प्रून करना/छंटनी करना) बेहतर है या उसी राशि का उपयोग करके शून्य से एक नई कार बनाना बेहतर है?
निष्कर्ष: "पुरानी" कार हर बार जीतती है।
यह शोध पत्र दिखाता है कि यदि आप एक विशाल, पूर्व-प्रशिक्षित (pre-trained) मॉडल लेते हैं और उसे छोटे आकार में काट देते हैं (प्रून करते हैं), तो वह छोटा मॉडल एक बड़ी बढ़त के साथ शुरुआत करता है। यह एक अनुभवी शेफ को एक छोटा रसोईघर देने जैसा है; वे तुरंत बेहतरीन भोजन बना सकते हैं। यदि आप एक नए शेफ को पहले दिन से ही उस छोटे रसोईघर में प्रशिक्षित करने का प्रयास करते हैं, तो उन्हें सीखने में बहुत अधिक समय लगता है और वे कभी भी उस अनुभवी शेफ की बराबरी नहीं कर पाते, भले ही आप उन्हें अभ्यास के लिए समान समय दें।
2. "फाइलिंग कैबिनेट" की उपमा (विशेषज्ञ संपीड़न/Expert Compression)
प्रश्न: जब आप विशेषज्ञों की टीम को छोटा करते हैं, तो आप यह कैसे तय करते हैं कि किसे हटाना है और किसे रखना है? क्या आपको बस उन्हें हटा देना चाहिए जो सबसे कम बोलते हैं?
निष्कर्ष: यह बहुत अधिक मायने नहीं रखता कि आप शुरुआती कटौती कैसे चुनते हैं, जब तक कि आप बाद में टीम को "पुनः प्रशिक्षित" (retrain) होने दें।
शोधकर्ताओं ने अलग-अलग तरीकों का परीक्षण किया कि विशेषज्ञों को चुनने के लिए कौन से तरीके अपनाए जाएं (जैसे कि उन्हें हटाना जो सबसे कम बोलते हैं, या जिनका स्कोर सबसे कम है), उन्होंने पाया कि एक बार जब छोटी टीम को बहुत अधिक नया अभ्यास (निरंतर प्री-ट्रेनिंग) मिल जाता है, तो वे सभी लगभग समान प्रदर्शन करने लगते हैं।
सीक्रेट सॉस (Secret Sauce): हालाँकि, उन्होंने "आंशिक संरक्षण" (Partial Preservation) नामक एक तरकीब खोजी। कल्पना करें कि आपके पास 100 विशेषज्ञ हैं और आपको 50 रखने हैं। केवल शीर्ष 50 को चुनने और बाकी को हटाने के बजाय, उन्होंने शीर्ष 25 को बिल्कुल वैसा ही रखा जैसा वे थे, और फिर शेष 25 स्थानों के लिए "हटाए गए" विशेषज्ञों को "रखे गए" विशेषज्ञों में मिला दिया। यह अपने स्टार खिलाड़ियों को बरकरार रखते हुए बेंच खिलाड़ियों के कौशल को स्टार्टर्स में मिलाने जैसा है। इस विशिष्ट रणनीति ने अंतिम टीम को केवल यादृच्छिक (randomly) रूप से शीर्ष 50 को चुनने की तुलना में थोड़ा अधिक स्मार्ट बनाया।
3. "ट्यूटर" की उपमा (डिस्टिलेशन/Distillation)
प्रश्न: हम छोटी टीम को बड़े मॉडल की तरह सोचना कैसे सिखाएं?
निष्कर्ष: उन्हें केवल सही उत्तर न बताएं; उन्हें बड़े मॉडल की "सोचने की प्रक्रिया" को सुनते हुए भी सीखने दें जबकि वे वास्तव में पाठ्यपुस्तक से भी सीख रहे हों।
आमतौर पर, जब मॉडल को छोटा किया जाता है, तो आप नॉलेज डिस्टिलेशन (Knowledge Distillation) नामक एक तकनीक का उपयोग करते हैं, जहाँ छोटा मॉडल बड़े मॉडल के उत्तरों की नकल करने की कोशिश करता है। शोध पत्र ने पाया कि सबसे अच्छा तरीका एक हाइब्रिड दृष्टिकोण है:
- पाठ्यपुस्तक: छोटे मॉडल को वास्तविक सही उत्तरों (Standard Language Modeling) से सीखने दें।
- ट्यूटर: उसे बड़े मॉडल के "सॉफ्ट" अनुमानों (Distillation) को भी सुनने दें।
दोनों को एक साथ करने से केवल बड़े मॉडल की नकल करने की तुलना में बेहतर परिणाम मिलते हैं।
नई तरकीब (MTP Distillation): उन्होंने मल्टी-टोकन प्रेडिक्शन (Multi-Token Prediction) नामक सिखाने का एक नया तरीका भी पेश किया।
- सामान्य शिक्षण: "यहाँ एक वाक्य है। अगला शब्द क्या है?"
- MTP शिक्षण: "यहाँ एक वाक्य है। अगला शब्द क्या है, और उसके बाद वाला, और उसके बाद वाला, और उसके बाद वाला?"
यह छोटे मॉडल को आगे की योजना बनाने में मदद करता है, जिससे यह बाद में टेक्स्ट जेनरेट करते समय तेज़ और अधिक सटीक हो जाता है।
4. "सीढ़ी" बनाम "खड़ी ढलान" की उपमा (प्रोग्रेसिव प्रूनिंग/Progressive Pruning)
प्रश्न: क्या हमें मॉडल को एक बार में ही काट देना चाहिए (वन-शॉट), या हमें इसे धीरे-धीरे चरणों में काटना चाहिए?
निष्कर्ष: सीढ़ी (Staircase) बेहतर है।
यदि आप एक विशाल मॉडल लेते हैं और तुरंत उसके आकार का 75% हिस्सा काट देते हैं, तो यह एक खड़ी ढलान (Cliff) से कूदने जैसा है। मॉडल भ्रमित हो जाता है और ज्ञान खो देता है।
इसके बजाय, शोधकर्ताओं ने पाया कि प्रोग्रेसिव प्रूनिंग (Progressive Pruning) सबसे अच्छा काम करती है। कल्पना करें कि आप एक सीढ़ी से नीचे उतर रहे हैं:
- मॉडल को थोड़ा काटें (उदाहरण के लिए, कुछ लेयर्स हटा दें)।
- इसे अभ्यास करने और स्थिर होने दें।
- थोड़ा और काटें।
- फिर से अभ्यास करने दें।
यह क्रमिक संक्रमण (gradual transition) मॉडल को प्रत्येक नए, छोटे आकार पर कार्य करने के तरीके को "पुनः सीखने" की अनुमति देता है, जिसके परिणामस्वरूप "खड़ी ढलान" विधि की तुलना में बहुत अधिक स्मार्ट उत्पाद प्राप्त होता है।
अंतिम परिणाम: SlimQwen
इन सभी तरकीबों को मिलाकर—एक प्रून्ड मॉडल से शुरुआत करना, विशेषज्ञों के लिए एक स्मार्ट "आंशिक संरक्षण" रणनीति का उपयोग करना, पाठ्यपुस्तक सीखने के साथ ट्यूटर मार्गदर्शन को मिलाना, और मॉडल को खड़ी ढलान के बजाय एक सीढ़ी के रूप में छोटा करना—उन्होंने सफलतापूर्वक एक विशाल 80-बिलियन-पैरामीटर वाले मॉडल को एक छोटे 23-बिलियन-पैरामीटर वाले मॉडल में संकुचित कर दिया।
लगभग 4 गुना छोटा होने के बावजूद, यह "SlimQwen" मॉडल गणित, कोडिंग और सामान्य ज्ञान जैसे कठिन कार्यों पर प्रतिस्पर्धी प्रदर्शन करता है, जो यह साबित करता है कि यदि आप इसे ठीक से सिकोड़ना जानते हैं, तो स्मार्ट चीजें करने के लिए आपको एक विशाल मस्तिष्क की आवश्यकता नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।