← नवीनतम पेपर
💬 NLP

MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping

यह शोध पत्र MoDES को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो वैश्विक रूप से-मॉड्यूलेटेड स्थानीय गेटिंग तंत्र और दोहरी-मोडैलिटी थ्रेशोल्डिंग का उपयोग करके Mixture-of-Experts मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को त्वरित करता है, जिससे अनावश्यक विशेषज्ञों को अनुकूल रूप से स्किप किया जा सकता है, और इस प्रकार मौजूदा विधियों की तुलना में अनुमान गति (inference speed) और सटीकता दोनों में महत्वपूर्ण सुधार करता है।

मूल लेखक: Yushi Huang, Zining Wang, Zhihang Yuan, Yifu Ding, Ruihao Gong, Jinyang Guo, Xianglong Liu, Jun Zhang

प्रकाशित 2026-02-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yushi Huang, Zining Wang, Zhihang Yuan, Yifu Ding, Ruihao Gong, Jinyang Guo, Xianglong Liu, Jun Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MoDES पेपर का सरल भाषा में अनुवाद दिया गया है, जिसमें रचनात्मक उपमाओं (analogies) का उपयोग किया गया है।

बड़ी समस्या: अत्यधिक कर्मचारियों वाली रसोई (The Over-Staffed Kitchen)

एक विशाल, उच्च श्रेणी के रेस्तरां की कल्पना करें (जो एक Multimodal Large Language Model या MLLM है) जो कुछ भी बना सकता है: कविताएँ लिख सकता है, एक्स-रे का विश्लेषण कर सकता है, या वीडियो का वर्णन कर सकता है। इसे संभालने के लिए, रसोई "Mixture of Experts" (MoE) सिस्टम का उपयोग करती है।

एक विशाल शेफ के बजाय जो सब कुछ करता है, रसोई में सैकड़ों विशेषज्ञ शेफ (जिन्हें Experts कहा जाता है) होते हैं।

  • एक शेफ सब्जियां काटने में माहिर है (Text)।
  • एक डेसर्ट सजाने में माहिर है (Images)।
  • एक रेसिपी पढ़ने में माहिर है (Videos)।

पेंच (The Catch): वर्तमान सेटअप में, हर एक ऑर्डर के लिए (हर शब्द या पिक्सेल के लिए), रसोई प्रबंधक सभी शेफ को वहां उपस्थित होने और व्यंजन चखने के लिए मजबूर करता है, भले ही उनमें से केवल दो ही वास्तव में जानते हों कि क्या करना है। यह अविश्वसनीय रूप से धीमा, महंगा और बर्बादी भरा है। यह ऐसा है जैसे एक अकेला सुर बजाने के लिए पूरे ऑर्केस्ट्रा को बुला लिया जाए।

असफल समाधान: "एक ही नियम सबके लिए" (The "One-Size-Fits-All" Rule)

वैज्ञानिकों ने इस नियम को बनाकर इसे ठीक करने की कोशिश की: "यदि कोई शेफ ऑर्डर में बहुत अधिक दिलचस्पी नहीं ले रहा है, तो उन्हें घर भेज दो।" इसे Expert Skipping कहा जाता है।

हालाँकि, जब उन्होंने इस नियम को मल्टीमॉडल रसोई पर लागू किया, तो यह उल्टा पड़ गया। प्रदर्शन गिर गया क्योंकि नियम बहुत बेवकूफी भरा था। इसने एक "टेक्स्ट ऑर्डर" और एक "वीडियो ऑर्डर" के साथ बिल्कुल एक जैसा व्यवहार किया, और "जूनियर शेफ" (शुरुआती लेयर्स) के साथ "हेड शेफ" (गहरी लेयर्स) जैसा ही व्यवहार किया।

समाधान: MoDES (स्मार्ट किचन मैनेजर)

लेखकों ने MoDES (Multimodal Dynamic Expert Skipping) बनाया। MoDES को एक सुपर-स्मार्ट, अनुकूलन योग्य (adaptive) किचन मैनेजर के रूप में सोचें जो दो महत्वपूर्ण टिप्पणियाँ करता है:

1. सभी शेफ समान नहीं होते (The "Layer" Insight)

  • अंतर्दत (Insight): खाना पकाने के शुरुआती चरणों में (shallow layers), शेफ तैयारी का भारी काम कर रहे होते हैं। यदि आप उन्हें छोड़ देते हैं, तो पूरा व्यंजन विफल हो जाएगा। बाद के चरणों में (deep layers), शेफ केवल अंतिम सजावट जोड़ रहे होते हैं। उन्हें छोड़ने से ज्यादा फर्क नहीं पड़ता।
  • उपमा: घर बनाने की कल्पना करें। यदि आप फाउंडेशन (नींव) टीम को छोड़ देते हैं (shallow layers), तो घर ढह जाएगा। यदि आप ट्रिम पेंट करने वाले कुछ लोगों को छोड़ देते हैं (deep layers), तो भी घर खड़ा रहेगा।
  • MoDES का समाधान: यह एक Global-Modulated Local Gating सिस्टम का उपयोग करता है। यह जानता है कि "फाउंडेशन शेफ" "ट्रिम शेफ" की तुलना में अधिक महत्वपूर्ण हैं और यह महत्वपूर्ण लोगों की रक्षा करता है जबकि कम महत्वपूर्ण लोगों को जाने देता है।

2. टेक्स्ट और इमेज के लिए अलग नियम चाहिए (The "Modality" Insight)

  • अंतर्दत (Insight): टेक्स्ट टोकन और इमेज टोकन अलग तरह से व्यवहार करते हैं। टेक्स्ट एक नाजुक 'सुफ्ले' (soufflé) की तरह है; इसे कई विशेषज्ञों द्वारा सटीक, सावधानीपूर्वक हैंडलिंग की आवश्यकता होती है। इमेज 'सूप के एक बड़े बर्तन' की तरह है; वे अधिक मजबूत हैं, और कई विशेषज्ञ वास्तव में केवल "अनावश्यक" (redundant) हैं।
  • उपमा: यदि आप एक कानूनी अनुबंध (Text) को एडिट कर रहे हैं, तो आपको एक सख्त, विस्तृत समीक्षा की आवश्यकता है। यदि आप पत्थरों के ढेर को व्यवस्थित कर रहे हैं (Images), तो आप थोड़ा अनौपचारिक हो सकते हैं।
  • MoDES का समाधान: यह Dual-Modality Thresholding का उपयोग करता है। इसके पास दो अलग-अलग नियम हैं:
    • नियम A (Text): "सख्त रहें। केवल उन शेफ को घर भेजें जो 90% सुनिश्चित हैं कि उनकी जरूरत नहीं है।"
    • नियम B (Images): "ढीले रहें। उन सभी को घर भेजें जो 50% सुनिश्चित नहीं हैं कि उनकी जरूरत है।"
    • यह सिस्टम को बिना परिणाम बिगाड़े इमेज के लिए बहुत अधिक विशेषज्ञों को स्किप करने की अनुमति देता है।

गुप्त हथियार: "फ्रंटियर सर्च" (The "Frontier Search")

यह पता लगाने के लिए कि ये नियम कितने सख्त या ढीले होने चाहिए, टीम को "गोल्डिलॉक्स" ज़ोन (सही संतुलन) खोजना था: इतना छोड़ें कि काम तेज़ हो, लेकिन इतना भी नहीं कि खाना खराब हो जाए।

आमतौर पर, इस सही संतुलन को खोजने में दिनों का परीक्षण और त्रुटि (trial and error) लगता है। MoDES एक Frontier Search Algorithm का उपयोग करता है।

  • उपमा: कल्पना करें कि आप शॉवर के लिए सही तापमान खोज रहे हैं। एक सामान्य व्यक्ति तब तक गर्म और ठंडे नॉब को बेतरतीब ढंग से घुमाता रहता है जब तक कि उसे सही तापमान न मिल जाए (इसमें बहुत समय लगता है)। MoDES एक ऐसे रोबोट की तरह है जो जानता है कि नॉब को एक तरफ घुमाने पर पानी गर्म होगा और दूसरी तरफ ठंडा। यह तुरंत सही ज़ोन के किनारे (edge) पर फिसल जाता है।
  • परिणाम: जिसे कैलकुलेट करने में 2 दिन लगते थे, अब उसमें केवल 2 घंटे लगते हैं।

परिणाम: तेज़, सस्ता और स्वादिष्ट

जब उन्होंने वास्तविक दुनिया के मॉडल्स (जैसे Qwen3-VL और Kimi-VL) पर MoDES का परीक्षण किया:

  • गति (Speed): इसने मॉडल्स को इनपुट पढ़ने में 2 गुना तेज़ और जवाब लिखने में 1.2 गुना तेज़ बना दिया।
  • दक्षता (Efficiency): इसने सफलतापूर्वक 88% विशेषज्ञों को स्किप कर दिया (88% शेफ को घर भेज दिया!) और कुछ मामलों में सटीकता में वास्तव में सुधार भी किया।
  • क्यों? क्योंकि "भटकाने वाले" या "अनावश्यक" शेफ को हटाने से, शेष विशेषज्ञ बेहतर ध्यान केंद्रित कर सके और कंप्यूटर ने अनावश्यक काम पर ऊर्जा बर्बाद नहीं की।

सारांश

MoDES एक स्मार्ट सिस्टम है जो मल्टीमॉडल AI मॉडल्स को ऊर्जा बर्बाद करने से रोकता है। हर कार्य के साथ एक जैसा व्यवहार करने के बजाय, यह महसूस करता है कि:

  1. शुरुआती चरण बाद के चरणों की तुलना में अधिक महत्वपूर्ण हैं।
  2. इमेज को स्किप करना टेक्स्ट की तुलना में आसान है।
  3. सही संतुलन बनाना तुरंत किया जा सकता है।

यह एक अराजक रसोई से एक सुव्यवस्थित, हाई-स्पीड रसोई में अपग्रेड करने जैसा है जहाँ केवल सही काम के लिए सही शेफ आते हैं, जिससे भोजन तेज़ और अधिक स्वादिष्ट बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →