← नवीनतम पेपर
🤖 machine learning

Beyond Task-Agnostic: Task-Aware Grouping for Communication-Efficient Multi-Task MoE Inference

यह शोध पत्र टास्क-अवेयर कोएक्टिवेशन ग्रुपिंग (TACG) और जेनेरिक एक्सपर्ट शेयर्ड रेप्लिकेशन (GESR) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो विशेषज्ञों को वैश्विक औसत के बजाय कार्य-विशिष्ट सह-सक्रियता पैटर्न के आधार पर समूहित करके मल्टी-टास्क MoE इन्फरेंस को अनुकूलित करता है, जिससे संचार लागत में काफी कमी आती है और विविध वर्कलोड्स के बीच लोड संतुलन बना रहता है।

मूल लेखक: Zhiyao Xu, Aoxue Liu, Zhanjie Ding, Dan Zhao, Yong Jiang, Qing Li

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiyao Xu, Aoxue Liu, Zhanjie Ding, Dan Zhao, Yong Jiang, Qing Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, उच्च-गति वाली लाइब्रेरी (एक AI मॉडल) चलाते हैं जहाँ हजारों अलग-अलग विशेषज्ञ (विशेष ज्ञान मॉड्यूल) एक गगनचुंबी इमारत (GPUs) के विभिन्न मंजिलों पर रहते हैं। जब कोई आगंतुक (उपयोगकर्ता का प्रश्न) आता है, तो लाइब्रेरियन (राउटर) तुरंत निर्णय लेता है कि उस विशिष्ट प्रश्न का उत्तर देने के लिए किन 6 विशेषज्ञों की आवश्यकता है।

समस्या: "एक ही आकार के सभी के लिए" वाला नक्शा (The "One-Size-Fits-All" Map)
अतीत में, लाइब्रेरी प्रबंधकों ने सभी आगंतुकों की आदतों का औसत निकालकर सबसे अच्छा फ्लोर प्लान figuring out करने की कोशिश की। उन्होंने यह माना कि क्योंकि "गणित" (Math) और "कोड" (Code) दोनों के प्रश्नों को कभी-कभी "विशेषज्ञ 5" की आवश्यकता होती है, इसलिए उन दोनों विशेषज्ञों को हमेशा पड़ोसी होना चाहिए।

लेकिन यह शोध पत्र तर्क देता है कि यह एक गलती है। यह ऐसा ही है जैसे यह मान लेना कि क्योंकि खाना पकाने से प्यार करने वाले व्यक्ति और गेमिंग से प्यार करने वाले व्यक्ति दोनों कभी-कभी "स्नैक बार" में जाते हैं, इसलिए उनके शौक एक ही हैं। वास्तव में:

  • एक गणित के प्रश्न को विशेषज्ञों A, B और C के एक साथ काम करने की आवश्यकता हो सकती है।
  • एक कोड के प्रश्न को विशेषज्ञों X, Y और Z के एक साथ काम करने की आवश्यकता हो सकती है।
  • विशेषज्ञों A और X को वास्तव में एक-दूसरे से बात करने की कभी आवश्यकता नहीं हो सकती।

यदि आप विशेषज्ञों A और X को एक ही मंजिल पर रखते हैं क्योंकि वे दोनों कभी-कभी देखे जाते हैं, तो आप ट्रैफिक जाम पैदा करते हैं। लाइब्रेरियन को सही विशेषज्ञों को पाने के लिए सीढ़ियाँ चढ़ने और उतरने (नेटवर्क पर डेटा भेजने) के लिए दौड़ना पड़ता है, जिससे सब कुछ धीमा हो जाता है। इसे "कम्युनिकेशन ओवरहेड" (Communication overhead) कहा जाता है।

समाधान: "कार्य-जागरूक" नक्शा (The "Task-Aware" Map - TACG)
लेखक एक नए तरीके से लाइब्रेरी को व्यवस्थित करने का प्रस्ताव देते हैं जिसे टास्क-अवेयर कोएक्टिवेशन ग्रुपिंग (TACG) कहा जाता है।

सभी की आदतों का औसत निकालने के बजाय, वे आगंतुकों के विशिष्ट समूहों को देखते हैं:

  1. रुचि के आधार पर समूह बनाना: वे "गणित" के आगंतुकों को "कोड" के आगंतुकों से अलग करते हैं।
  2. पड़ोस का मानचित्रण करना: वे देखते हैं कि गणित के आगंतुक हमेशा विशेषज्ञों के एक विशिष्ट क्लस्टर (समूह) को भेजते हैं जो एक साथ पास रहते हैं। कोड के आगंतुक एक अलग क्लस्टर को भेजते हैं।
  3. मंजिलों को पुनर्गठित करना: वे विशेषज्ञों को इस तरह से स्थानांतरित करते हैं कि "गणित क्लस्टर" मंजिलों के एक सेट पर रहता है, और "कोड क्लस्टर" मंजिलों के दूसरे सेट पर रहता है।

उपमा (Analogy):
इसे एक व्यस्त हवाई अड्डे को व्यवस्थित करने की तरह सोचें।

  • पुराना तरीका: आप सभी "बिजनेस ट्रैवलर्स" और "वेकेशनर्स" को एक ही वेटिंग लाउंज में रखते हैं क्योंकि दोनों समूहों को औसतन शौचालय के उपयोग की आवश्यकता होती है। इससे अराजकता पैदा होती है।
  • नया तरीका (TACG): आप महसूस करते हैं कि बिजनेस ट्रैवलर्स को ज्यादातर "मीटिंग रूम" और "कॉफी" की आवश्यकता होती है, जबकि वेकेशनर्स को "स्मारिका" (Souvenirs) और "स्नैक्स" की आवश्यकता होती है। आप एक "बिजनेस ज़ोन" और एक "वेकेशन ज़ोन" बनाते हैं। अब, लोगों को अपनी ज़रूरत की चीज़ों के लिए पूरे हवाई अड्डे में नहीं घूमना पड़ता। यातायात का प्रवाह बहुत सुचारू हो जाता है।

सुरक्षा जाल: "यूनिवर्सल हेल्पर्स" (The "Universal Helpers" - GESR)
यहाँ एक पेच है। कुछ विशेषज्ञ "यूनिवर्सल हेल्पर्स" (जैसे एक सामान्य डॉक्टर या सुरक्षा गार्ड) होते हैं। उनकी आवश्यकता सभी को होती है (गणित, कोड और कानूनी प्रश्नों जैसे सभी को)। यदि आप उन्हें केवल एक मंजिल पर रखते हैं, तो वह मंजिल ट्रैफिक से दब जाएगी जबकि अन्य खाली बैठी रहेंगी।

इसे ठीक करने के लिए, शोध पत्र जेनेरिक एक्सपर्ट शेयर्ड रेप्लिकेशन (GESR) पेश करता है।

  • उपमा: कल्पना करें कि "यूनिवर्सल हेल्पर" एक प्रसिद्ध शेफ है। केवल एक रसोई में एक शेफ रखने के बजाय, आपके पास विभिन्न रसोईयों में उस शेफ की कुछ प्रतियां हैं।
  • स्मार्ट चयन: जब कोई आगंतुक आता है, तो सिस्टम यह जाँचता है कि कौन सी रसोई वर्तमान में सबसे कम व्यस्त है और अनुरोध को वहीं भेज देता है। यह सुनिश्चित करता है कि भले ही हर कोई अचानक "यूनिवर्सल हेल्पर" को चाहता हो, फिर भी कोई एक मंजिल ओवरलोड न हो।

परिणाम
लेखकों ने तीन अलग-अलग AI मॉडल (DeepSeek, Qwen, और Moonlight) पर इनका परीक्षण किया।

  • गति (Speed): विशेषज्ञों को विशिष्ट कार्यों के लिए वास्तव में एक साथ काम करने वालों के आधार पर व्यवस्थित करके, उन्होंने "सीढ़ियाँ चढ़ने और उतरने" (कम्युनिकेशन) को लगभग 31% कम कर दिया।
  • निष्पक्षता (Fairness): उन्होंने यह सुनिश्चित किया कि वे किसी भी एकल मंजिल पर ट्रैफिक जाम पैदा किए बिना यह सब कर सकें। कार्यभार पूरी तरह से संतुलित रहा (लगभग 100% का फेयरनेस स्कोर)।

संक्षेप में
शोध पत्र कहता है: "सभी AI कार्यों के साथ एक जैसा व्यवहार करना बंद करें।" यह महसूस करके कि विभिन्न प्रकार के प्रश्न (गणित बनाम कोड) विशेषज्ञों की अलग-अलग टीमों को सक्रिय करते हैं, हम उन विशेषज्ञों को कंप्यूटर चिप्स पर इस तरह व्यवस्थित कर सकते हैं कि वे एक साथ बहुत तेज़ी से काम कर सकें, और इसके लिए AI के मस्तिष्क को बदलने की आवश्यकता नहीं है। यह गैरेज में कारों को पार्क करने का एक स्मार्ट तरीका है ताकि हर कोई तेज़ी से बाहर निकल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →