Pruning and Distilling Mixture-of-Experts into Dense Language Models
यह शोध पत्र एक नवीन ढांचे (framework) को प्रस्तुत करता है जो प्रशिक्षित मिक्सचर-ऑफ़-एक्सपर्ट्स (MoE) मॉडलों को स्कोरिंग, चयन और विशेषज्ञों के समूहीकरण के बाद नॉलेज डिस्टिलेशन के माध्यम से मानक डेंस आर्किटेक्चर में परिवर्तित करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण सटीकता और प्रशिक्षण दक्षता में पारंपरिक डेंस-टू-डेंस प्रूनिंग की तुलना में काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Pruning and Distilling Mixture-of-Experts into Dense Language Models" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।
बड़ी समस्या: "ऑल-हैंड्स-ऑन-डेक" (सबकी उपस्थिति की आवश्यकता) वाली बाधा
एक विशाल, हाई-एंड रेस्टोरेंट किचन (MoE मॉडल) की कल्पना करें जिसे अविश्वसनीय रूप से जटिल व्यंजन बनाने के लिए डिज़ाइन किया गया है। इस किचन में 128 अलग-अलग विशेषज्ञ शेफ (experts) स्टाफ के रूप में हैं। हालाँकि, किसी भी एक ऑर्डर के लिए, हेड शेफ (राउटर) केवल उनमें से 8 को काम करने के लिए बुलाता है। बाकी 120 शेफ अपनी बारी का इंतज़ार करते हुए खाली खड़े रहते हैं।
यह सेटअप खाना पकाने की गति और विविधता के लिए तो बेहतरीन है, लेकिन इसमें एक बड़ी समस्या है: किचन खोलने के लिए, आपको सभी 128 शेफ को काम पर रखना होगा और उन्हें वेतन देना होगा। भले ही आप एक बार में केवल 8 का ही उपयोग करते हों, आपको उन सभी 128 को पेरोल पर रखने के लिए पर्याप्त जगह (मेमोरी) और पैसा (कंप्यूट) चाहिए। यह इस कारण से असंभव बना देता है कि इस रेस्टोरेंट की एक छोटी शाखा किसी छोटी दुकान (जैसे फोन या एकल कंप्यूटर) में खोली जाए, क्योंकि इतने सारे स्टाफ के लिए पर्याप्त जगह नहीं है।
मौजूदा समाधान कुछ शेफ को नौकरी से निकालने (fire करने) की कोशिश करते हैं ताकि किचन छोटा हो सके, लेकिन फिर भी आपको बाकी बचे हुए शेफ को अलग-अलग, विशिष्ट स्टेशनों पर रखना पड़ता है। आपको अभी भी उन सभी को इमारत के अंदर लोड करना ही पड़ेगा।
समाधान: "मास्टर शेफ" रूपांतरण
इस पेपर के लेखक एक बिल्कुल नए रेसिपी का प्रस्ताव देते हैं। केवल शेफ को नौकरी से निकालने के बजाय, वे सबसे अच्छे 8 शेफ को एक 'सुपर-शेफ' में मिलाना चाहते हैं जो वह सब कुछ कर सके जो पूरी टीम ने किया था, लेकिन बिना अतिरिक्त जगह की आवश्यकता के।
वे 128 विशेषज्ञों की प्रशिक्षित टीम को लेते हैं और उन्हें एक मानक, डेंस किचन (एक Dense मॉडल) में बदल देते हैं जो एक छोटी दुकान में फिट हो सके लेकिन फिर भी एक मास्टर की तरह खाना पका सके।
उन्होंने यह कैसे किया: तीन-चरणीय प्रक्रिया
पेपर एक "MoE किचन" को "डेंस किचन" में बदलने के लिए तीन-चरणीय प्रक्रिया का वर्णन करता है।
1. स्कोरिंग: "स्टार" शेफ को खोजना
सबसे पहले, उन्हें यह तय करने की ज़रूरत है कि किन शेफ को रखना है। वे केवल उन्हीं को नहीं चुन सकते जिन्हें सबसे अधिक बार बुलाया जाता है (फ्रीक्वेंसी), क्योंकि वे "जनरलिस्ट" हो सकते हैं जो सब कुछ ठीक-ठाक तो करते हैं लेकिन कुछ भी महान नहीं।
- पुराना तरीका: उन शेफ को चुनें जिन्हें सबसे अधिक बार बुलाया जाता है। (जैसे सबसे लोकप्रिय कर्मचारियों को चुनना)।
- नया तरीका (विविधता-जागरूक स्कोरिंग - Diversity-Aware Scoring): लेखकों ने DO-ACP नामक एक नया मीट्रिक बनाया है। कल्पना करें कि आप एक स्पोर्ट्स टीम चुन रहे हैं। आप केवल उन 8 खिलाड़ियों को नहीं चुनते जो सबसे अधिक मैच खेलते हैं; आप उन 8 खिलाड़ियों को चुनते हैं जिनके पास सबसे अलग-अलग कौशल हैं और जो उन विशिष्ट कौशलों में सर्वश्रेष्ठ हैं।
- यदि शेफ A बेकिंग में महान है और शेफ B ग्रिलिंग में महान है, तो आप दोनों को चाहते हैं।
- यदि शेफ C और शेफ D दोनों ग्रिलिंग में महान हैं, तो आपको केवल एक की ही आवश्यकता है।
- नया तरीका गणितीय रूप से यह सुनिश्चित करता है कि चयनित शेफ बिना किसी दोहराव के "स्वादों" (ज्ञान) की विस्तृत श्रृंखला को कवर करें।
2. ग्रुपिंग और मर्जिंग: सुपर-शेफ का निर्माण
एक बार जब वे शीर्ष 8 शेफ (या सुरक्षा के लिए कुछ अधिक) चुन लेते हैं, तो उन्हें मिलाना होगा।
- शुद्ध प्रूनिंग (विजेता): अधिकांश मामलों में, सबसे अच्छा परिणाम सीधे शीर्ष 8 शेफ को बिना उनकी रेसिपी मिलाए नए किचन में कॉपी करने से आया। यह पाया गया कि उनके व्यंजनों को एक औसत रेसिपी में मिलाने की कोशिश करने के बजाय, 8 अलग-अलग, उच्च-गुणवत्ता वाले विशेषज्ञों को अगल-बगल में रखना बेहतर है।
- मर्जिंग (Merging): यदि उन्हें 8 से अधिक चुनने की आवश्यकता होती, तो वे समान शेफ की रेसिपी को उनके प्रदर्शन के आधार पर मिलाकर तैयार करते।
3. नॉलेज डिस्टिलेशन: "टेस्ट टेस्ट" ट्रेनिंग
अब उनके पास 8 शेफ वाला एक नया किचन (स्टूडेंट) है, लेकिन यह अभी भी पूर्ण नहीं है। यह एक नए रेस्टोरेंट की तरह है जिसके पास सही स्टाफ तो है लेकिन उसने अभी तक गुप्त पारिवारिक रेसिपी नहीं सीखी है।
वे मूल 128-शेफ वाले किचन (टीचर) के साथ नए किचन को काम पर लगाते हैं।
- टीचर एक व्यंजन बनाता है।
- स्टूडेंट ठीक वही व्यंजन बनाने की कोशिश करता है।
- टीचर स्टूडेंट को सुधारता है: "नहीं, तुमने बहुत अधिक नमक डाला," या "तुमने सूक्ष्म मसाले को छोड़ दिया।"
- स्टूडेंट इन सुधारों से सीखता है। इस प्रक्रिया को नॉलेज डिस्टिलेशन (Knowledge Distillation) कहा जाता है।
परिणाम: यह क्यों मायने रखता है
लेखकों ने कई विशाल AI मॉडलों (जैसे Qwen3, DeepSeek, और GPT-OSS) पर इसका परीक्षण किया। यहाँ उन्हें क्या पता चला:
- सही शेफ चुनना ही सब कुछ है: शेफ को स्कोर करने के लिए इस्तेमाल की गई विधि ने उनके समूह बनाने के तरीके से अधिक महत्व दिया। उनका नया "विविधता-जागरूक" (Diversity-Aware) स्कोरिंग स्पष्ट विजेता था, जिसने सभी पिछले तरीकों को बड़े अंतर से पीछे छोड़ दिया।
- मिलाएँ नहीं, बस चुनें: आश्चर्यजनक रूप से, सबसे अच्छी रणनीति यह थी कि ठीक 8 शेफ को चुना जाए और उन्हें बिल्कुल न मिलाया जाए। बस उन 8 सर्वश्रेष्ठ, विविध विशेषज्ञों को एक साथ रखना उन्हें औसत बनाने से बेहतर था।
- प्रतियोगिता को हराना: उन्होंने अपने "MoE-to-Dense" तरीके की तुलना पुराने तरीके (एक बड़े डेंस मॉडल को छोटा करने के तरीके) से की।
- परिणाम: उनके नए तरीके ने एक ऐसा स्टूडेंट मॉडल तैयार किया जो औसत कार्यों पर 6.3% अधिक सटीक था।
- गति: यह प्रशिक्षण के दौरान प्रक्रिया को चलाने के लिए मूल "टीचर" किचन अधिक कुशल होने के कारण, प्रशिक्षण के लिए भी 1.6 गुना तेज़ था।
मुख्य निष्कर्ष (Bottom Line)
इस पेपर को एक विशाल कॉर्पोरेट मुख्यालय को एक छोटी, कुशल स्टार्टअप ऑफिस में डाउनसाइज करने के ब्लूप्रिंट के रूप में देखें, बिना कंपनी की किसी भी बौद्धिक शक्ति को खोए।
किराया बचाने के लिए केवल लोगों को नौकरी से निकालने के बजाय, उन्होंने सावधानीपूर्वक सबसे विविध और प्रतिभाशाली 8 कर्मचारियों को चुना, उन्हें एक नया, कॉम्पैक्ट ऑफिस दिया, और उन्हें मूल बड़ी टीम से कंपनी के रहस्य सीखने दिए। परिणाम? एक छोटा कार्यालय जो बड़े कार्यालय के समान ही प्रदर्शन करता है, लेकिन बहुत कम स्थान में फिट हो जाता है।
मुख्य बात: आपको परिणामों के लिए पूरी विशाल टीम रखने की आवश्यकता नहीं है; आपको बस सही 8 को चुनना, उन्हें अलग रखना, और उन्हें अच्छी तरह से सिखाना होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।