← नवीनतम पेपर
🤖 machine learning

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training

यह शोध पत्र बड़े पैमाने के Mixture-of-Experts (MoE) मॉडलों को प्रीट्रेनिंग के दौरान कंप्रेस करने के लिए स्ट्रक्चर्ड प्रूनिंग और नॉलेज डिस्टिलेशन की व्यवस्थित जांच करता है, यह प्रदर्शित करते हुए कि प्रूनिंग बेहतर इनिशियलाइजेशन प्रदान करती है, क्रमिक कंप्रेशन शेड्यूल्स वन-शॉट विधियों से बेहतर प्रदर्शन करते हैं, और लैंग्वेज मॉडलिंग को मल्टी-टोकन प्रेडिक्शन डिस्टिलेशन के साथ संयोजित करने से काफी छोटे मॉडल में प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

मूल लेखक: Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang, Xiulong Yuan, Zihan Qiu, Zhiqiang Shen, Dayiheng Liu

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang, Xiulong Yuan, Zihan Qiu, Zhiqiang Shen, Dayiheng Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास ज्ञान का एक विशाल, अत्यंत तीव्र पुस्तकालय (एक बहुत बड़ा AI मॉडल) है जो चलाने में अविश्वसनीय रूप से महंगा और पढ़ने में धीमा है। आप इसे एक जेब के आकार के संस्करण में सिकोड़ना चाहते हैं जो लगभग सब कुछ जानता हो, बिना उस पुस्तकालय को फिर से शून्य से बनाए।

यह शोध पत्र, जिसका शीर्षक "SlimQwen" है, विशेष रूप से Mixture-of-Experts (MoE) नामक एक विशिष्ट प्रकार के AI आर्किटेक्चर के लिए यह करने का एक मार्गदर्शक (गाइडबुक) है। MoE मॉडल को एक एकल मस्तिष्क के रूप में नहीं, बल्कि विशेषज्ञों की एक विशाल टीम के रूप में सोचें। कुछ गणित के जीनियस हैं, कुछ कोडिंग के जादूगर हैं, और कुछ भाषा विशेषज्ञ हैं। आमतौर पर, किसी भी प्रश्न का उत्तर देने के लिए केवल कुछ ही विशेषज्ञों को बुलाया जाता है।

शोधकर्ताओं ने पूछा: हम विशेषज्ञों की इस विशाल टीम को एक छोटी, तेज़ टीम में कैसे बदल सकते हैं बिना उनकी सामूहिक प्रतिभा को खोए?

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. "पुरानी कार" बनाम "शून्य से निर्माण" की उपमा

प्रश्न: क्या एक बड़ी, थोड़ी संशोधित कार खरीदना (एक बड़े मॉडल को प्रून करना/छंटनी करना) बेहतर है या उसी राशि का उपयोग करके शून्य से एक नई कार बनाना बेहतर है?
निष्कर्ष: "पुरानी" कार हर बार जीतती है।
यह शोध पत्र दिखाता है कि यदि आप एक विशाल, पूर्व-प्रशिक्षित (pre-trained) मॉडल लेते हैं और उसे छोटे आकार में काट देते हैं (प्रून करते हैं), तो वह छोटा मॉडल एक बड़ी बढ़त के साथ शुरुआत करता है। यह एक अनुभवी शेफ को एक छोटा रसोईघर देने जैसा है; वे तुरंत बेहतरीन भोजन बना सकते हैं। यदि आप एक नए शेफ को पहले दिन से ही उस छोटे रसोईघर में प्रशिक्षित करने का प्रयास करते हैं, तो उन्हें सीखने में बहुत अधिक समय लगता है और वे कभी भी उस अनुभवी शेफ की बराबरी नहीं कर पाते, भले ही आप उन्हें अभ्यास के लिए समान समय दें।

2. "फाइलिंग कैबिनेट" की उपमा (विशेषज्ञ संपीड़न/Expert Compression)

प्रश्न: जब आप विशेषज्ञों की टीम को छोटा करते हैं, तो आप यह कैसे तय करते हैं कि किसे हटाना है और किसे रखना है? क्या आपको बस उन्हें हटा देना चाहिए जो सबसे कम बोलते हैं?
निष्कर्ष: यह बहुत अधिक मायने नहीं रखता कि आप शुरुआती कटौती कैसे चुनते हैं, जब तक कि आप बाद में टीम को "पुनः प्रशिक्षित" (retrain) होने दें।
शोधकर्ताओं ने अलग-अलग तरीकों का परीक्षण किया कि विशेषज्ञों को चुनने के लिए कौन से तरीके अपनाए जाएं (जैसे कि उन्हें हटाना जो सबसे कम बोलते हैं, या जिनका स्कोर सबसे कम है), उन्होंने पाया कि एक बार जब छोटी टीम को बहुत अधिक नया अभ्यास (निरंतर प्री-ट्रेनिंग) मिल जाता है, तो वे सभी लगभग समान प्रदर्शन करने लगते हैं।
सीक्रेट सॉस (Secret Sauce): हालाँकि, उन्होंने "आंशिक संरक्षण" (Partial Preservation) नामक एक तरकीब खोजी। कल्पना करें कि आपके पास 100 विशेषज्ञ हैं और आपको 50 रखने हैं। केवल शीर्ष 50 को चुनने और बाकी को हटाने के बजाय, उन्होंने शीर्ष 25 को बिल्कुल वैसा ही रखा जैसा वे थे, और फिर शेष 25 स्थानों के लिए "हटाए गए" विशेषज्ञों को "रखे गए" विशेषज्ञों में मिला दिया। यह अपने स्टार खिलाड़ियों को बरकरार रखते हुए बेंच खिलाड़ियों के कौशल को स्टार्टर्स में मिलाने जैसा है। इस विशिष्ट रणनीति ने अंतिम टीम को केवल यादृच्छिक (randomly) रूप से शीर्ष 50 को चुनने की तुलना में थोड़ा अधिक स्मार्ट बनाया।

3. "ट्यूटर" की उपमा (डिस्टिलेशन/Distillation)

प्रश्न: हम छोटी टीम को बड़े मॉडल की तरह सोचना कैसे सिखाएं?
निष्कर्ष: उन्हें केवल सही उत्तर न बताएं; उन्हें बड़े मॉडल की "सोचने की प्रक्रिया" को सुनते हुए भी सीखने दें जबकि वे वास्तव में पाठ्यपुस्तक से भी सीख रहे हों।
आमतौर पर, जब मॉडल को छोटा किया जाता है, तो आप नॉलेज डिस्टिलेशन (Knowledge Distillation) नामक एक तकनीक का उपयोग करते हैं, जहाँ छोटा मॉडल बड़े मॉडल के उत्तरों की नकल करने की कोशिश करता है। शोध पत्र ने पाया कि सबसे अच्छा तरीका एक हाइब्रिड दृष्टिकोण है:

  • पाठ्यपुस्तक: छोटे मॉडल को वास्तविक सही उत्तरों (Standard Language Modeling) से सीखने दें।
  • ट्यूटर: उसे बड़े मॉडल के "सॉफ्ट" अनुमानों (Distillation) को भी सुनने दें।
    दोनों को एक साथ करने से केवल बड़े मॉडल की नकल करने की तुलना में बेहतर परिणाम मिलते हैं।

नई तरकीब (MTP Distillation): उन्होंने मल्टी-टोकन प्रेडिक्शन (Multi-Token Prediction) नामक सिखाने का एक नया तरीका भी पेश किया।

  • सामान्य शिक्षण: "यहाँ एक वाक्य है। अगला शब्द क्या है?"
  • MTP शिक्षण: "यहाँ एक वाक्य है। अगला शब्द क्या है, और उसके बाद वाला, और उसके बाद वाला, और उसके बाद वाला?"
    यह छोटे मॉडल को आगे की योजना बनाने में मदद करता है, जिससे यह बाद में टेक्स्ट जेनरेट करते समय तेज़ और अधिक सटीक हो जाता है।

4. "सीढ़ी" बनाम "खड़ी ढलान" की उपमा (प्रोग्रेसिव प्रूनिंग/Progressive Pruning)

प्रश्न: क्या हमें मॉडल को एक बार में ही काट देना चाहिए (वन-शॉट), या हमें इसे धीरे-धीरे चरणों में काटना चाहिए?
निष्कर्ष: सीढ़ी (Staircase) बेहतर है।
यदि आप एक विशाल मॉडल लेते हैं और तुरंत उसके आकार का 75% हिस्सा काट देते हैं, तो यह एक खड़ी ढलान (Cliff) से कूदने जैसा है। मॉडल भ्रमित हो जाता है और ज्ञान खो देता है।
इसके बजाय, शोधकर्ताओं ने पाया कि प्रोग्रेसिव प्रूनिंग (Progressive Pruning) सबसे अच्छा काम करती है। कल्पना करें कि आप एक सीढ़ी से नीचे उतर रहे हैं:

  1. मॉडल को थोड़ा काटें (उदाहरण के लिए, कुछ लेयर्स हटा दें)।
  2. इसे अभ्यास करने और स्थिर होने दें।
  3. थोड़ा और काटें।
  4. फिर से अभ्यास करने दें।
    यह क्रमिक संक्रमण (gradual transition) मॉडल को प्रत्येक नए, छोटे आकार पर कार्य करने के तरीके को "पुनः सीखने" की अनुमति देता है, जिसके परिणामस्वरूप "खड़ी ढलान" विधि की तुलना में बहुत अधिक स्मार्ट उत्पाद प्राप्त होता है।

अंतिम परिणाम: SlimQwen

इन सभी तरकीबों को मिलाकर—एक प्रून्ड मॉडल से शुरुआत करना, विशेषज्ञों के लिए एक स्मार्ट "आंशिक संरक्षण" रणनीति का उपयोग करना, पाठ्यपुस्तक सीखने के साथ ट्यूटर मार्गदर्शन को मिलाना, और मॉडल को खड़ी ढलान के बजाय एक सीढ़ी के रूप में छोटा करना—उन्होंने सफलतापूर्वक एक विशाल 80-बिलियन-पैरामीटर वाले मॉडल को एक छोटे 23-बिलियन-पैरामीटर वाले मॉडल में संकुचित कर दिया।

लगभग 4 गुना छोटा होने के बावजूद, यह "SlimQwen" मॉडल गणित, कोडिंग और सामान्य ज्ञान जैसे कठिन कार्यों पर प्रतिस्पर्धी प्रदर्शन करता है, जो यह साबित करता है कि यदि आप इसे ठीक से सिकोड़ना जानते हैं, तो स्मार्ट चीजें करने के लिए आपको एक विशाल मस्तिष्क की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →