← नवीनतम पेपर
🤖 AI

ConMoE: Expert-Pool Consolidation via Prototype Reassignment for MoE Compression

ConMoE एक 'ट्रेन-फ्री' फ्रेमवर्क है जो मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) मॉडल्स को कंप्रेस करने के लिए प्रोटोटाइप एक्सपर्ट्स के एक छोटे सेट का चयन करके एक्सपर्ट पूल को समेकित करता है और मूल एक्सपर्ट कॉल्स को उन्हें नियत रूप से रिमैप करता है, जिससे बिना किसी वेट अपडेट या पोस्ट-कंप्रेशन फाइन-ट्यूनिंग के मेमोरी लागत को कम किया जा सकता है।

मूल लेखक: Yilun Yao, Jiaming Pan, Elsie Dai, Peizhuang Cong, Yaoming Li, Tong Yang

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilun Yao, Jiaming Pan, Elsie Dai, Peizhuang Cong, Yaoming Li, Tong Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, उच्च-स्तरीय रेस्टोरेंट किचन है। यह किचन एक Mixture-of-Experts (MoE) सिस्टम के साथ डिज़ाइन किया गया है। ऐसा नहीं है कि हर शेफ हर व्यंजन बनाता है, बल्कि इस किचन में सैकड़ों विशेषज्ञ "शेफ" (विशेषज्ञ) हैं। जब कोई ऑर्डर आता है, तो एक "रूटर" (मुख्य वेटर) डिश को देखता है और तुरंत उन शीर्ष 2 या 3 शेफ को बुलाता है जो उस विशिष्ट कार्य के लिए सबसे अच्छे हैं।

समस्या:
भले ही प्रत्येक व्यंजन को केवल कुछ ही शेफ बनाते हैं, फिर भी रेस्टोरेंट को उन सैकड़ों शेफ के लिए किराया, वर्दी का भंडारण और उपकरणों का खर्च उठाना पड़ता है। जैसे-जैसे रेस्टोरेंट बढ़ता है (AI मॉडल बड़ा होता है), यह भंडारण लागत बहुत बड़ी हो जाती है, जिससे इसे चलाना महंगा और धीमा हो जाता है, भले ही सभी शेफ एक साथ काम न कर रहे हों।

पुराने समाधान:
पिछले तरीकों ने इस किचन को दो तरह से छोटा करने की कोशिश की:

  1. प्रूनिंग (Pruning): उन शेफ को निकाल देना जो कम व्यस्त दिखते हैं।
  2. मर्जिंग (Merging): दो शेफ को लेना, उनकी रेसिपी को आपस में मिला देना, और एक नया "सुपर-शेफ" बनाना जिसका एक मिश्रित स्टाइल हो।

नया समाधान: ConMoE
ConMoE एक अलग दृष्टिकोण अपनाता है। यह शेफ को निकालने या उनकी रेसिपी मिलाने के बजाय कहता है: "आइए हम अपने मूल शेफों की एक छोटी, चुनि गई टीम रखें, और बस हेड वेटर को उन्हें काम भेजने के लिए कहें।"

यह कैसे काम करता है, रोज़मर्रा के उदाहरणों का उपयोग करते हुए:

1. "प्रोटोटाइप" टीम (स्टार शेफ)

ConMoE सभी मूल शेफों को देखता है और उनमें से एक छोटा समूह चुनता है जिन्हें "प्रोटोटाइप्स" कहा जाता है। ये वही मूल, बिना किसी बदलाव वाले शेफ हैं जिन्हें स्टाफ पर रखा जाता है।

  • इन्हें कैसे चुना जाता है: सिस्टम दो चीजें जाँचता है:
    • योगदान (Contribution): किसे सबसे ज्यादा बुलाया जाता है और कौन सबसे अच्छा काम करता है?
    • प्रतिस्थापनीयता (Replaceability): कौन अद्वितीय (unique) है? यदि हम शेफ A को खो देते हैं, तो क्या कोई और है जो ठीक वही काम कर सकता है जो वे करते हैं? यदि शेफ A अद्वितीय है, तो वे बने रहते हैं। यदि शेफ B बहुत हद तक शेफ C जैसा ही है, तो शेफ B को हटाया जा सकता है।

2. "रीमैपिंग" (नया मेनू)

एक बार जब प्रोटोटाइप शेफों की छोटी टीम चुन ली जाती है, तो ConMoE एक डिटरमिनिस्टिक मैप (एक सख्त नियम पुस्तिका) बनाता है।

  • यदि मूल हेड वेटर "शेफ #42" को बुलाना चाहता था, तो नियम पुस्तिका कहती है, "वास्तव में, यह ऑर्डर प्रोटोटाइप शेफ #5 को भेजें।"
  • यदि वेटर को "शेफ #99" को बुलाना था, तो नियम पुस्तिका कहती है, "इसे प्रोटोटाइप शेफ #5 को ही भेजें।"
  • महत्वपूर्ण बात: शेफ खुद नहीं बदलते। वे नई रेसिपी नहीं सीखते, और न ही वे अपनी शैली को मिलाते हैं। उन्हें बस पुन: उपयोग किया जाता है। "रूटर" (हेड वेटर) को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; वह बस नए मैप का पालन करता है।

3. "लोकल नेबरहुड" (स्थानीय पड़ोस) का नियम

पेपर में पाया गया कि आप पूरे बिल्डिंग से किसी भी शेफ को दूसरे को बदलने के लिए नहीं चुन सकते।

  • उदाहरण: पहली मंजिल पर काम करने वाला एक शेफ (AI के शुरुआती लेयर्स) 50वीं मंजिल के शेफ (गहरे लेयर्स) की तुलना में बहुत अलग काम करता है। वे एक-दूसरे के स्थान पर नहीं आ सकते।
  • समाधान: ConMoE केवल शेफ को उनके "लोकल नेबरहुड" (कुछ मंजिल ऊपर या नीचे) के अन्य शेफों के साथ बदलने की अनुमति देता है। यह सुनिश्चित करता है कि बदलने वाला शेफ वास्तव में ऑर्डर के संदर्भ (context) को समझता हो।

यह बेहतर क्यों है?

  • कोई री-ट्रेनिंग नहीं: आपको शेफ को नए करतब सिखाने की ज़रूरत नहीं है (कोई "फाइन-ट्यूनिंग" नहीं)। आपको बस फोन डायरेक्टरी बदलनी है।
  • स्थिरता: क्योंकि शेफ को मिलाया या बदला नहीं जाता है, इसलिए उनके मूल कौशल बरकरार रहते हैं।
  • परिणाम: पेपर ने तीन अलग-अलग बड़े AI मॉडलों पर इसका परीक्षण किया। उन्होंने पाया कि ConMoE उन तरीकों की तरह ही (या कभी-कभी उनसे भी बेहतर) प्रदर्शन करता है जो शेफ को निकालते हैं या उनकी रेसिपी मिलाते हैं, जबकि यह सिस्टम को बहुत सरल रखता है।

कमी (सीमाएं)

  • इसे पढ़ने के लिए एक "मेनू" चाहिए: सिस्टम को यह पता लगाने के लिए कि कौन से शेफ स्टार हैं और कौन से बैकअप हैं, थोड़े से नमूना टेक्स्ट (कैलिब्रेशन डेटा) की आवश्यकता होती है।
  • केवल स्थानीय (Local only): आप बेसमेंट के शेफ को पेंटहाउस के शेफ से नहीं बदल सकते; वे अलग-अलग काम करते हैं।
  • भंडारण की वास्तविकता: हालांकि लॉजिकल रूप से शेफ की संख्या कम है, लेकिन वास्तव में भौतिक भंडारण स्थान बचाने के लिए, रेस्टोरेंट को एक विशेष तरीके से बिल्डिंग को स्टोर करने की आवश्यकता है ताकि कई "स्लॉट्स" एक ही भौतिक शेफ की ओर इशारा कर सकें।

संक्षेप में: ConMoE अपने मूल विशेषज्ञों की एक छोटी, कुलीन टीम रखने और सारा काम उन पर पुनर्निर्देशित करने जैसा है, बजाय इसके कि शेफ को निकाला जाए या नए "हाइब्रिड" विशेषज्ञों को बनाया जाए। यह बड़े AI मॉडलों को छोटा करने का एक स्मार्ट, बिना प्रशिक्षण वाला तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →