← नवीनतम पेपर
🤖 AI

UBEP: Re-architecting Expert Parallelism Communication Library for Production Superpods

UBEP एक प्रोडक्शन-रेडी कम्युनिकेशन लाइब्रेरी है जो उच्च-बैंडविड्थ वाले सुपरपॉड्स के लिए Mixture-of-Experts (MoE) All-to-All प्रिमिटिव्स को पुनर्गठित करती है, जो सीरियलाइजेशन, सिंक्रोनाइज़ेशन और लोड इम्बैलेंस की बाधाओं को दूर करके All-to-All लेटेंसी को 52.4% तक और इन्फरेंस TPOT को 11.1% तक कम करती है।

मूल लेखक: Yipeng Liu, Chang Liu, Si Shen, Jiaqi Zheng, Mingfan Li, Yuyang Yang, Guanhua Li, Yuquan Zhang, Yimeng Xu, Zhongzhe Hu, Zhiyuan Huang, Qihang Duan, Junsong Wang, Wenkai Ling, Baochuan Yang, Xianzhi Yu
प्रकाशित 2026-07-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yipeng Liu, Chang Liu, Si Shen, Jiaqi Zheng, Mingfan Li, Yuyang Yang, Guanhua Li, Yuquan Zhang, Yimeng Xu, Zhongzhe Hu, Zhiyuan Huang, Qihang Duan, Junsong Wang, Wenkai Ling, Baochuan Yang, Xianzhi Yu, Han Bao, Yijie Chen, Guihai Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "UBEP: प्रोडक्शन सुपरपॉड्स के लिए एक्सपर्ट पैरेललिज्म कम्युनिकेशन लाइब्रेरी का पुनर्गठन" पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी तस्वीर: एक सुपर-एक्सप्रेस डिलीवरी सिस्टम

कल्पना कीजिए कि आप एक विशाल, हाई-टेक पिज्जा फैक्ट्री (Superpod) चला रहे हैं जहाँ सैकड़ों शेफ (AI Chips) मिलकर लाखों पिज्जा (AI Model Tokens) बनाने के लिए काम करते हैं।

इस फैक्ट्री में एक विशेष नियम है: हर पिज्जा का ऑर्डर केवल एक शेफ के पास नहीं जाता। इसके बजाय, ऑर्डर को विभाजित किया जाता है, और विशिष्ट टॉपिंग्स उन "एक्सपर्ट" शेफों को भेजी जाती हैं जो उस सामग्री में विशेषज्ञ हैं। इसे Mixture-of-Experts (MoE) मॉडल कहा जाता है।

समस्या क्या है? इन शेफों के बीच बातचीत करने का वर्तमान तरीका एक धीमी, नौकरशाही वाली असेंबली लाइन की तरह है। भले ही इस फैक्ट्री में दुनिया के सबसे तेज़ कन्वेयर बेल्ट (हाई-स्पीड कनेक्शन) हों, फिर भी शेफ एक-दूसरे का इंतज़ार करने, सूचियाँ चेक करने और खाली खड़े रहने में फंसे हुए हैं।

UBEP एक नया प्रबंधन सिस्टम है जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है। यह धीमी असेंबली लाइन को एक अराजक, उच्च-गति, और पूरी तरह से समन्वित नृत्य (dance) में बदल देता है, जिससे फैक्ट्री बहुत तेज़ी से चलती है।


तीन बड़ी समस्याएँ (बॉटलनेक्स)

लेखकों ने पाया कि मौजूदा सिस्टम धीमा क्यों है, भले ही वह सबसे तेज़ हार्डवेयर पर हो:

1. "रुको और इंतज़ार करो" ट्रैफिक जाम (BSP Serialization)

पुराना तरीका: कल्पना कीजिए कि एक स्कूल बस है जहाँ ड्राइवर तब तक किसी को भी उतरने नहीं देता जब तक कि हर एक छात्र खड़ा होकर हाथ न उठा ले। भले ही एक छात्र 1 सेकंड में तैयार हो जाए, उसे उस सबसे धीमे छात्र का इंतज़ार करना पड़ता है जिसे 10 सेकंड लगते हैं।
वास्तविकता: AI फैक्ट्रियों में, सिस्टम एक "बल्क सिंक्रोनस पैरेलल" (BSP) मॉडल का उपयोग करता है। यह सभी चिप्स को अगले चरण पर जाने से पहले एक वैश्विक "ऑल क्लियर" सिग्नल का इंतज़ार करने के लिए मजबूर करता है। क्योंकि नई सुपर-फैक्ट्रियां इतनी तेज़ हैं, इसलिए डेटा को हिलाने के समय के बजाय, इस सिग्नल का इंतज़ार करने में बिताया गया समय अब सबसे बड़ा बॉटलनेक बन गया है।

2. "झंडा लहराने" का टैक्स (Synchronization Overhead)

पुराना तरीका: कल्पना कीजिए कि एक रिले रेस है जहाँ, दौड़ने वाले के बैटन पास करने से पहले, उन्हें रुकना पड़ता है, एक झंडा लहराना पड़ता है, अगले धावक के झंडा लहराने का इंतज़ार करना पड़ता है, और फिर दौड़ना पड़ता है।
वास्तविकता: चिप्स "मैं तैयार हूँ" सिग्नल (झंडे) भेजने और "क्या आप हो गए?" संदेशों को चेक करने में बहुत अधिक समय बिताते हैं। इन नई सुपर-फास्ट मशीनों पर, इन डिजिटल झंडों को लहराने में बिताया गया समय वास्तव में वास्तविक काम करने के समय से अधिक है।

3. "एक ही आकार का नक्शा" (Topology-Agnostic Scheduling)

पुराना तरीका: कल्पना कीजिए कि एक डिलीवरी ड्राइवर शहर के हर घर को समान दूरी पर मानता है। उसे यह अहसास नहीं है कि कुछ घर बिल्कुल बगल में (1-हॉप) हैं जबकि अन्य शहर के दूसरे छोर पर (2-हॉप) हैं। वे पड़ोसी के लिए उसी रूट लॉजिक का उपयोग करके दूर के घर तक पैकेज भेज देते हैं, जिससे देरी होती है।
वास्तविकता: नई फैक्ट्रियों में एक जटिल लेआउट होता है। कुछ चिप्स एक-दूसरे के बिल्कुल बगल में होते हैं (तेज़), जबकि अन्य कुछ स्विचों द्वारा अलग किए जाते हैं (धीमे)। पुराना सॉफ्टवेयर उनके साथ एक जैसा व्यवहार करता है, जिससे भारी ट्रैफिक धीमे रास्तों पर चला जाता है और "स्ट्रैग्लर्स" (धीमे दौड़ने वाले) पैदा होते हैं जो पूरी टीम को रोक देते हैं।


UBEP समाधान: उन्होंने इसे कैसे ठीक किया?

लेखकों ने इन तीन समस्याओं को हल करने के लिए UBEP (यूनिफाइड-बस एक्सपर्ट पैरेललिज्म) बनाया।

1. असेंबली लाइन को तोड़ना (Kernel Decomposition)

सभी के स्टेप A पूरा करने का इंतज़ार करने के बजाय, UBEP काम को छोटे-छोटे टुकड़ों में तोड़ देता है।

  • उपमा: एक बस के इंतज़ार करने के बजाय, एक टैक्सी बेड़े की कल्पना करें। जैसे ही एक यात्री तैयार होता है, टैक्सी उसे तुरंत ले जाती है। जब तक प्याज काटने वाले कुछ शेफ अभी भी काम कर रहे हैं, तब तक दूसरे लोग पिज्जा पर चीज़ डालना शुरू कर चुके होते हैं।
  • परिणाम: सिस्टम कार्यों को ओवरलैप करता है। जब चिप्स का एक समूह डेटा भेज रहा होता है, तो दूसरा समूह पहले से ही गणना कर रहा होता है कि अगले बैच का डेटा कहाँ जाना चाहिए। कोई भी खाली नहीं बैठता।

2. झंडे को छिपाना (Data-as-Flag)

UBEP अलग से "मैं तैयार हूँ" झंडे का उपयोग करना बंद कर देता है।

  • उपमा: यह कहने के लिए कि "मैं हो गया हूँ," अलग से झंडा लहराने के बजाय, शेफ सीधे पिज्जा बॉक्स पर ही "मैं हो गया हूँ" लिख देता है। अगला व्यक्ति बस बॉक्स को देखकर जान जाता है कि वह तैयार है।
  • परिणाम: क्योंकि हार्डवेयर एक ही झटके में डेटा का पूरा बॉक्स (512 बाइट्स) लिख सकता है, इसलिए "झंडा" और "डेटा" एक साथ पहुँचते हैं। इससे अलग से झंडे लहराने में बर्बाद होने वाला समय समाप्त हो जाता है।

3. स्मार्ट GPS (Hierarchical Token Scheduling)

UBEP एक स्मार्ट मैप का उपयोग करता है जो जानता है कि हर चिप दूसरे चिप से कितनी दूर है।

  • उपमा: डिलीवरी ड्राइवर के पास अब एक GPS है जो जानता है कि कौन से घर "बगल में" हैं और कौन से "शहर के दूसरे छोर पर" हैं। वे "बगल वाले" डिलीवरी को तेज़ धावकों को और "दूर वाले" डिलीवरी को धीमे धावकों को सौंप देते हैं, जिससे काम का भार संतुलित रहता है ताकि सभी लगभग एक ही समय पर काम पूरा कर सकें।
  • परिणाम: अब कोई स्ट्रैगलर (पीछे छूटने वाला) नहीं है। सिस्टम काम को इस तरह संतुलित करता है कि सबसे धीमा रास्ता ओवरलोड न हो, जिससे पूरी फैक्ट्री सुचारू रूप से चलती रहती है।

परिणाम: कितनी तेज़?

लेखकों ने इस नए सिस्टम का परीक्षण एक विशाल वास्तविक दुनिया की फैक्ट्री (Huawei का CM384 सुपरपॉड) में 256 AI चिप्स के साथ किया।

  • स्पीड बूस्ट: उन्होंने चिप्स के बीच डेटा ले जाने के समय (All-to-All latency) को 52.4% तक कम कर दिया। यह प्रतीक्षा समय को आधे से भी कम करने जैसा है।
  • वास्तविक प्रभाव: अंतिम AI मॉडल (जैसे चैटबॉट) के लिए, इसने प्रत्येक शब्द उत्पन्न करने के समय (Time Per Output Token) को 11.1% कम कर दिया।

सारांश

यह पेपर तर्क देता है कि इन नई, अविश्वसनीय रूप से तेज़ AI सुपर-फैक्ट्रियों का अधिकतम लाभ उठाने के लिए, हम पुराने सॉफ्टवेयर का उपयोग नहीं कर सकते जो धीमा और सरल मशीनों के लिए बनाया गया था। हमें चिप्स को एक-दूसरे का इंतज़ार करना बंद करने, अनावश्यक झंडे लहराना बंद करने और काम को संतुलित करने के लिए स्मार्ट मैप का उपयोग करने की आवश्यकता है। UBEP नया सॉफ्टवेयर है जो बिल्कुल यही करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →