← नवीनतम पेपर
💬 NLP

Less is MoE: Trimming Experts in Domain-Specialist Language Models

यह शोध पत्र Fisher-MoE को प्रस्तुत करता है, जो एक ऐसा संपीड़न (compression) तरीका है जो फिशर महत्व (Fisher importance) का उपयोग करके FFN परतों के भीतर कार्य-महत्वपूर्ण (task-critical) मध्यवर्ती आयामों की पहचान करता है और उन्हें हटाता है, जिससे सामान्य-उद्देश्य वाले बेंचमार्क पर उनके प्रदर्शन को बनाए रखते हुए मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडलों में महत्वपूर्ण मेमोरी और थ्रूपुट लाभ प्राप्त होता है।

मूल लेखक: Haoze He, Xinkai Zou, Xuan Jiang, Xingyuan Ding, Ao Qu, Juncheng Billy Li, Heather Miller

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoze He, Xinkai Zou, Xuan Jiang, Xingyuan Ding, Ao Qu, Juncheng Billy Li, Heather Miller

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, उच्च-शक्ति वाला भाषा मॉडल (language model) एक विशाल रसोई है जिसे साधारण टोस्ट से लेकर जटिल पांच-कोर्स के भोज तक, कोई भी व्यंजन बनाने के लिए डिज़ाइन किया गया है।

समस्या: एक रसोई जो आपके घर में फिट न हो सके

यह रसोई (जिसे Mixture-of-Experts या MoE मॉडल कहा जाता है) अविश्वसनीय रूप से स्मार्ट है क्योंकि इसमें सैकड़ों विशेषज्ञ शेफ (जिन्हें "एक्सपर्ट्स" कहा जाता है) हैं। जब आप कोई सवाल पूछते हैं, तो एक स्मार्ट मैनेजर (जिसे "राउटर" कहा जाता है) आपके विशिष्ट कार्य के लिए सबसे उपयुक्त कुछ शेफ को चुनता है।

हालाँकि, यह रसोई बहुत बड़ी है। इसे इतनी जगह (मेमोरी) की आवश्यकता होती है और इतने सारे शेफ को स्टैंडबाय पर रखने की ज़रूरत होती है कि इसे एक सामान्य घर (एक मानक कंप्यूटर या फोन) में फिट करना असंभव है। आपको बिना अच्छे भोजन बनाने की क्षमता खोए, इस रसोई को सिकोड़ना होगा।

पुराना तरीका: पूरे शेफ को नौकरी से निकालना

रसोई को छोटा करने के पिछले प्रयास पूरे शेफ को नौकरी से निकालने जैसे थे।

  • यदि कोई शेफ अक्सर खाना नहीं बनाता था, या यदि उसका एप्रन छोटा था, तो मैनेजर उन्हें नौकरी से निकाल देते थे।
  • परिणाम: यह एक आपदा थी। भले ही आपने सबसे "बेहतरीन" शेफ को रखा, लेकिन आपने अनजाने में उस व्यक्ति को निकाल दिया जो सटीक गणित के सवाल हल करने के लिए गुप्त सामग्री (secret ingredient) जानता था। अचानक, रसोई अभी भी चुटकुले सुना सकती थी (ज्ञान), लेकिन वह बुनियादी अंकगणित भी नहीं कर पा रही थी। पूरा सिस्टम ढह गया।

नई खोज: समस्या शेफ की नहीं, बल्कि उनके औजारों की है

इस शोध पत्र के लेखकों ने कुछ आश्चर्यजनक खोजा: समस्या यह नहीं है कि आप किन शेफ को रखते हैं; बल्कि यह है कि वे कौन से विशिष्ट औजारों का उपयोग करते हैं।

प्रत्येक शेफ के स्टेशन के अंदर, हजारों छोटे औजार (जिन्हें intermediate dimensions कहा जाता है) होते हैं।

  • अधिकांश औजार बस वहीं पड़े रहते हैं और उन पर धूल जमी रहती है।
  • लेकिन कुछ चुनिचुने विशिष्ट औजार अत्यंत महत्वपूर्ण हैं। उदाहरण के लिए, एक विशिष्ट "चाकू" ही एकमात्र ऐसी चीज़ हो सकती है जो रसोई को गणित के कठिन सवाल हल करने की अनुमति देती है, जबकि दूसरा "चम्मच" कोडिंग करने के लिए महत्वपूर्ण हो सकता है।

पुराने तरीके ऐसे थे जैसे किसी पूरे शेफ के स्टेशन को इसलिए फेंक देना क्योंकि उसने एक "धूल भरा चम्मच" इस्तेमाल किया था, यह समझे बिना कि उसी शेफ के पास "महत्वपूर्ण गणित वाला चाकू" भी था।

समाधान: "Fisher-MoE" (एक सटीक स्कैल्पल/सर्जिकल ब्लेड)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे Fisher-MoE कहा जाता है। शेफ को निकालने के बजाय, वे एक विशेष स्कैनर (जिसे Fisher Importance कहा जाता है) का उपयोग करके रसोई के हर एक औजार का निरीक्षण करते हैं।

  1. स्कैनर: यह मापता है कि यदि आप किसी विशिष्ट औजार को हटा दें, तो रसोई के प्रदर्शन में कितनी गिरावट आएगी।
    • उपमा: कल्पना कीजिए कि आप रसोई के हर चाकू का परीक्षण कर रहे हैं। यदि आप "चाकू A" को हटाते हैं, तो रसोई टोस्ट बना सकती है। लेकिन यदि आप "चाकू B" को हटाते हैं, तो रसोई टमाटर नहीं काट पाएगी। स्कैनर "चाकू B" को महत्वपूर्ण के रूप में पहचानता है।
  2. ट्रिमिंग (कटौती): वे किसी को नौकरी से नहीं निकालते। इसके बजाय, वे वर्कस्टेशन को भौतिक रूप से छोटा कर देते हैं। वे "धूल भरे चम्मचों" और "अप्रयुक्त स्पैटुलों" (कम स्कोर वाले औजारों) को हटा देते हैं, लेकिन "महत्वपूर्ण चाकुओं" (उच्च स्कोर वाले औजारों) को रखते हैं।
  3. परिणाम: वे रसोई को 50% तक सिकोड़ सकते हैं (आधे औजारों को हटाकर) और रसोई अभी भी लगभग पूरी तरह से काम करती है।
    • यह अभी भी कठिन गणित हल कर सकती है।
    • यह अभी भी कोड लिख सकती है।
    • यह अभी भी सामान्य ज्ञान (trivia) के उत्तर दे सकती है।
    • बोनस: क्योंकि रसोई छोटी है, इसलिए यह तेजी से खाना बनाती है (21% तेज़) और बहुत कम जगह घेरती है (45% कम मेमोरी)।

यह क्यों महत्वपूर्ण है

  • अंधाधुंध प्रहार के बजाय सटीकता: पुराना तरीका एक हथौड़ा था (पूरे लोगों को निकालना)। यह नया तरीका एक स्कैल्पल (सर्जिकल ब्लेड) है (केवल बेकार के हिस्सों को हटाना)।
  • "गणित" का रहस्य: उन्होंने पाया कि यदि आप 1.35 मिलियन में से केवल 12 विशिष्ट औजारों को हटा देते हैं, तो रसोई तुरंत गणित करना भूल जाती है, भले ही उसे बाकी सब कुछ याद हो। यह साबित करता है कि जटिल कौशल छोटे, विशिष्ट कोनों में छिपे होते हैं, न कि पूरे मॉडल में समान रूप से फैले हुए।
  • अनुकूलता: यह सिकोड़ने की विधि अन्य स्थान-बचाने वाली तकनीकों (जैसे "quantization") के साथ पूरी तरह से काम करती है, जिसका अर्थ है कि आप मॉडल को बिना तोड़े और भी अधिक छोटा कर सकते हैं।

संक्षेप में

शोध पत्र कहता है: विशेषज्ञों को निकालें नहीं; बस उनके टूलकिट (औजारों के सेट) को छाँटें। विशेषज्ञों के भीतर बेकार के "औजारों" को पहचानने और हटाने के लिए एक स्मार्ट स्कैनर का उपयोग करके, हम इन विशाल AI मॉडलों को आधा आकार का, दोगुना तेज़ और पहले जैसा ही स्मार्ट बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →