← नवीनतम पेपर
🤖 machine learning

Fast MoE Inference via Predictive Prefetching and Expert Replication

यह शोध पत्र एक गतिशील विशेषज्ञ प्रतिकृति रणनीति (dynamic expert replication strategy) प्रस्तावित करता है जो ओवरलोडेड विशेषज्ञों का पूर्वानुमान लगाती है और उन्हें डुप्लिकेट करती है ताकि समवर्ती प्रसंस्करण (concurrent processing) सक्षम हो सके, जिससे बेसलाइन मॉडल के अधिकांश प्रदर्शन को बनाए रखते हुए लगभग पूर्ण GPU उपयोगिता और मिक्सचर ऑफ एक्सपर्ट्स (MoE) इन्फरेंस में 3x तक की गति वृद्धि प्राप्त की जा सके।

मूल लेखक: Ankit Jyothish, Ali Jannesari, Aishwarya Sarkar, Joseph Zuber

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ankit Jyothish, Ali Jannesari, Aishwarya Sarkar, Joseph Zuber

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "मिक्सचर ऑफ एक्सपर्ट्स" (Mixture of Experts - MoE) नामक एक विशाल, हाई-स्पीड रेस्टोरेंट चलाते हैं। इस रेस्टोरेंट में सैकड़ों विशिष्ट शेफ (जिन्हें एक्सपर्ट्स कहा जाता है) के साथ एक बहुत बड़ा मेनू है। प्रत्येक शेफ एक बहुत ही विशिष्ट व्यंजन का उस्ताद है।

जब कोई ग्राहक ऑर्डर करता है, तो मुख्य वेटर (जिसे राउटर कहा जाता है) ऑर्डर को देखता है और तय करता है कि किस विशिष्ट शेफ को खाना बनाना चाहिए। समस्या यह है कि अधिकांश ऑर्डर केवल कुछ लोकप्रिय शेफों के पास जाते हैं, जबकि अन्य 90% शेफ खाली बैठे रहते हैं, अपने खाली स्टेशनों को घूरते हुए।

इससे दो बड़ी समस्याएं पैदा होती हैं:

  1. व्यस्त शेफ काम के बोझ से दबे हुए हैं: यदि 50 ग्राहक एक ही व्यंजन का ऑर्डर देते हैं, तो उन्हें उस एक शेफ के लिए लंबी कतार में इंतजार करना पड़ता है।
  2. खाली बैठे शेफ बेकार जा रहे हैं: रसोई बहुत बड़ी है, लेकिन अधिकांश जगह और उपकरण खाली पड़े हैं, जो पैसे और ऊर्जा की बर्बादी है।

पुराना तरीका बनाम नया विचार

पुराना तरीका (स्टैंडर्ड MoE):
रसोई कोशिश करती है कि सभी शेफ एक साथ तैयार रहें। लेकिन क्योंकि शेफ बहुत विशिष्ट हैं, इसलिए रसोई खाली स्टेशनों से भर जाती है और कुछ व्यस्त शेफ ट्रैफिक जाम में फंस जाते हैं। रेस्टोरेंट धीमा चलता है।

पिछला समाधान (SiDA-MoE):
वैज्ञानिकों ने एक स्मार्ट तरीका अपनाया: उन्होंने ग्राहकों के आने से पहले ही अनुमान लगाया कि कौन से शेफ व्यस्त होंगे और केवल उन विशिष्ट शेफों को सामने की पंक्ति में लाया। इससे मदद मिली, लेकिन अगर 50 लोगों ने एक ही चीज़ का ऑर्डर दिया, तो वे कुछ शेफ अभी भी लाइन में फंसे हुए थे।

नया समाधान (MoE-MPMC):
इस पेपर के लेखकों ने एक "प्रेडिक्टिव प्रीफेचिंग एंड एक्सपर्ट रेप्लिकेशन" (Predictive Prefetching and Expert Replication) रणनीति प्रस्तावित की है। इसे एक अत्यधिक संगठित किचन मैनेजर के रूप में समझें जो दो काम करता है:

  1. क्रिस्टल बॉल (प्रेडिक्टिव प्रीफेचिंग):
    मैनेजर केवल ऑर्डर आने का इंतज़ार करने के बजाय, एक बहुत ही तेज़, सरल क्रिस्टल बॉल (जिसे SRU कहा जाता है, जो एक प्रकार का AI मॉडल है) का उपयोग करता है ताकि यह अनुमान लगाया जा सके कि अगले बैच के ग्राहक क्या ऑर्डर करेंगे।
  • उपमा: यह एक ऐसे शेफ की तरह है जो जानता है कि हर मंगलवार शाम 6 बजे, हर कोई पिज्जा ऑर्डर करता है। इसलिए, वह शाम 5:55 बजे ही पिज्जा का आटा तैयार करना शुरू कर देता है, इससे पहले कि पहला ग्राहक अंदर आए।
  1. क्लोन आर्मी (एक्सपर्ट रेप्लिकेशन):
    यही असली गेम-चेंजर है। यदि मैनेजर को भविष्यवाणी होती है कि 50 लोग "स्पाइसी टैकोस" ऑर्डर करेंगे, तो वे केवल एक टैको शेफ को नहीं लाते। वे तुरंत उस टैको शेफ के 32 क्लोन सामने की पंक्ति में ले आते हैं।
  • उपमा: कल्पना कीजिए कि आपको 100 बक्से हिलाने की ज़रूरत है, और एक व्यक्ति द्वारा एक-एक करके बक्से ले जाने के बजाय, आप जादुई रूप से खुद को 32 बार क्लोन कर लेते हैं। अब, 32 आप एक ही समय में बक्से ले जा रहे हैं। लाइन गायब हो जाती है, और काम तुरंत पूरा हो जाता है।

यह रसोई में कैसे काम करता है

सिस्टम दो टीमों को एक साथ चलाता है:

  • टीम A (कुक/रसोइए): वे क्लोन किए गए शेफों का उपयोग करके ग्राहकों के वर्तमान बैच को सेवा देने में व्यस्त होते हैं।
  • टीम B (प्रेडिक्टर्स/अनुमान लगाने वाले): टीम A काम कर रही होती है, तभी टीम B अगले बैच के ग्राहकों को देख रही होती है, क्रिस्टल बॉल का उपयोग करके यह अनुमान लगा रही होती है कि किसकी आवश्यकता होगी, और अगले राउंड के लिए क्लोन सेट कर रही होती है।

क्योंकि ग्राहक आने से पहले ही क्लोन तैयार होते हैं, इसलिए ग्राहकों को कभी भी लाइन में इंतजार नहीं करना पड़ता। रसोई (कंप्यूटर चिप, या GPU) हमेशा 100% व्यस्त रहती है क्योंकि लोड को संभालने के लिए हमेशा पर्याप्त शेफ मौजूद होते हैं।

परिणाम

इस पेपर का परीक्षण बहुत बड़े लैंग्वेज मॉडल्स (जैसे उन्नत AI चैटबॉट्स के पीछे के दिमाग) पर 128 और 256 अलग-अलग "शेफ" के साथ किया गया।

  • गति (Speed): रेस्टोरेंट 3 गुना तेज़ हो गया।
  • दक्षता (Efficiency): रसोई 1-10% व्यस्तता से बढ़कर लगभग 100% व्यस्त हो गई। कोई और बर्बाद जगह या खाली बैठे शेफ नहीं रहे।
  • गुणवत्ता (Quality): भोजन (AI के जवाब) पहले की तरह ही अच्छा रहा, सटीकता में केवल मामूली कमी (लगभग 5-10%) आई, जो कि तेज़ होने के लिए एक छोटा सा मूल्य है।

सारांश

सरल शब्दों में, यह पेपर कहता है: "केवल यह अनुमान न लगाएं कि आपको किस विशेषज्ञ की आवश्यकता है; इसे जल्दी अनुमान लगाएं, और यदि आपको लगता है कि बहुत से लोग उस विशेषज्ञ की आवश्यकता रखते हैं, तो उस विशेषज्ञ को क्लोन करें ताकि सभी को एक साथ सेवा दी जा सके।" यह एक धीमी, ऊबड़-खाबड़ प्रक्रिया को एक सुचारू, हाई-स्पीड हाईवे में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →