← नवीनतम पेपर
🤖 machine learning

Scalable Training of Mixture-of-Experts Models with Megatron Core

यह शोध पत्र मेग्रोटन कोर (Megatron Core) प्रस्तुत करता है, जो एक स्केलेबल और प्रोडक्शन-रेडी ओपन-सोर्स फ्रेमवर्क है जो एकीकृत सिस्टम-स्तरीय अनुकूलन के माध्यम से मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) प्रशिक्षण की युग्मित मेमोरी, संचार और गणना संबंधी चुनौतियों का समाधान करता है, जिससे बड़े पैमाने के GPU क्लस्टर्स पर अरबों से लेकर ट्रिलियन पैरामीटर्स तक के मॉडल्स का उच्च-प्रदर्शन प्रशिक्षण सक्षम होता है।

मूल लेखक: Zijie Yan (NVIDIA), Hongxiao Bai (NVIDIA), Xin Yao (NVIDIA), Dennis Liu (NVIDIA), Tong Liu (NVIDIA), Hongbin Liu (NVIDIA), Pingtian Li (NVIDIA), Evan Wu (NVIDIA), Shiqing Fan (NVIDIA), Li Tao (NVIDIA)
प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zijie Yan (NVIDIA), Hongxiao Bai (NVIDIA), Xin Yao (NVIDIA), Dennis Liu (NVIDIA), Tong Liu (NVIDIA), Hongbin Liu (NVIDIA), Pingtian Li (NVIDIA), Evan Wu (NVIDIA), Shiqing Fan (NVIDIA), Li Tao (NVIDIA), Robin Zhang (NVIDIA), Yuzhong Wang (NVIDIA), Shifang Xu (NVIDIA), Jack Chang (NVIDIA), Xuwen Chen (NVIDIA), Kunlun Li (NVIDIA), Yan Bai (NVIDIA), Gao Deng (NVIDIA), Nan Zheng (NVIDIA), Vijay Anand Korthikanti (NVIDIA), Abhinav Khattar (NVIDIA), Ethan He (NVIDIA), Soham Govande (NVIDIA), Sangkug Lym (NVIDIA), Zhongbo Zhu (NVIDIA), Qi Zhang (NVIDIA), Haochen Yuan (NVIDIA), Xiaowei Ren (NVIDIA), Deyu Fu (NVIDIA), Tailai Ma (NVIDIA), Shunkang Zhang (NVIDIA), Jiang Shao (NVIDIA), Ray Wang (NVIDIA), Santosh Bhavani (NVIDIA), Xipeng Li (NVIDIA), Chandler Zhou (NVIDIA), David Wu (NVIDIA), Yingcan Wei (NVIDIA), Ashwath Aithal (NVIDIA), Michael Andersch (NVIDIA), Mohammad Shoeybi (NVIDIA), Jiajie Yao (NVIDIA), June Yang (NVIDIA)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अति-बुद्धिमान मस्तिष्क (एक लार्ज लैंग्वेज मॉडल) बनाने की कोशिश कर रहे हैं ताकि जटिल समस्याओं को हल किया जा सके। अतीत में, इस मस्तिष्क को और स्मार्ट बनाने के लिए, आप इसे बस बड़ा और भारी बना देते थे, जैसे दीवार में और अधिक ईंटें जोड़ना। लेकिन इससे यह मस्तिष्क अविश्वसनीय रूप से धीमा और महंगा हो जाता था क्योंकि हर एक विचार के लिए हर एक ईंट का काम करना आवश्यक होता था।

मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) एक क्रांतिकारी नया तरीका है जिससे इस मस्तिष्क का निर्माण किया जाता है। एक विशाल मस्तिष्क के बजाय, एक विशेषज्ञ सलाहकारों (Experts) की एक टीम की कल्पना करें (100 विशेषज्ञ)। जब आप कोई प्रश्न पूछते हैं, तो एक मैनेजर (रौटर) उन सभी 100 विशेषज्ञों को नहीं जगाता। इसके बजाय, वह उन शीर्ष 2 या 3 विशेषज्ञों को चुनता है जो उस विशिष्ट विषय के लिए सबसे अच्छे हैं और केवल उन्हें ही काम करने के लिए कहता है।

यह अद्भुत है क्योंकि मस्तिष्क बहुत बड़ा (लाखों विशेषज्ञ) हो सकता है, लेकिन यह प्रत्येक प्रश्न के लिए केवल एक छोटे से हिस्से का ही उपयोग करता है। यह एक ऐसी लाइब्रेरी की तरह है जिसमें लाखों किताबें हैं, लेकिन आप केवल वही दो किताबें निकालते हैं जिनकी आपको उस क्षण आवश्यकता है।

हालाँकि, इस प्रणाली को प्रशिक्षित करना एक लॉजिस्टिक दुःस्वप्न है। NVIDIA का नया पेपर, "Scalable Training of Mixture-of-Experts Models with Megatron Core," वास्तव में इस विशाल सलाहकार टीम को कुशलतापूर्वक चलाने के लिए एक परम संचालन मैनुअल (operations manual) है। वे जिन समस्याओं को हल किया है, उन्हें "थ्री वॉल्स" (तीन दीवारें) कहते हैं।

यहाँ बताया गया है कि उन्होंने इन दीवारों को कैसे तोड़ा, सरल शब्दों में:

1. द मेमोरी वॉल: "फिटिंग रूम की समस्या"

समस्या: भले ही एक समय में केवल कुछ ही विशेषज्ञ काम करते हैं, लेकिन सभी 100 विशेषज्ञों को कमरे (GPU मेमोरी) में मौजूद होना चाहिए, यदि आवश्यकता पड़े। यदि आपके पास दस लाख विशेषज्ञ हैं, तो कमरा उनके बायोडाटा और उपकरणों से इतना भर जाएगा कि आप उन सभी को फिट नहीं कर पाएंगे।
समाधान:

  • कंप्रेशन (संपीड़न): उन्होंने विशेषज्ञों को हल्के बैकपैक ले जाने के लिए प्रशिक्षित किया (FP8/FP4 प्रिसिजन का उपयोग करके)। विस्तृत ब्लूप्रिंट ले जाने के बजाय, वे सरलीकृत रेखाचित्र ले जाते हैं जो 50% से 75% तक छोटे होते हैं लेकिन काम पूरा कर देते हैं।
  • "डू-इट-योरसेल्फ" ट्रिक: विशेषज्ञों के काम के हर एक चरण को कमरे में स्टोर करने के बजाय, वे नोट्स को फेंक देते हैं और बाद में आवश्यकता पड़ने पर विशेषज्ञों को चरणों को पुनः गणना (re-calculate) करने के लिए कहते हैं। इसमें पुन: गणना करने में थोड़ा अधिक समय लगता है, लेकिन यह स्थान की भारी बचत करता है।
  • अटारी (The Attic): जिस चीज़ की उन्हें अभी आवश्यकता नहीं है, उसे वे अटारी (CPU मेमोरी) में भेज देते हैं और जब बिल्कुल आवश्यक हो तभी उसे नीचे लाते हैं।

2. द कम्युनिकेशन वॉल: "ट्रैफिक जाम"

समस्या: चूंकि मैनेजर अलग-अलग प्रश्नों के लिए अलग-अलग विशेषज्ञों को चुनता है, इसलिए विशेषज्ञ अलग-अलग इमारतों (GPUs) में बिखरे हुए होते हैं। जब कोई प्रश्न आता है, तो मैनेजर को इधर-उधर दौड़ना पड़ता है, सही विशेषज्ञों को पकड़ना पड़ता है, उन्हें काम की मेज पर लाना पड़ता है, और फिर उन्हें वापस भेजना पड़ता है। यदि आपके पास हजारों इमारतें हैं, तो घूमने में बिताया गया समय (कम्युनिकेशन) वास्तव में काम करने के समय से अधिक लंबा हो जाता है।
समाधान:

  • सुपर-हाईवे: उन्होंने इन विशेषज्ञों को ले जाने के लिए विशेष, अत्यंत तेज़ सड़कें (DeepEP और HybridEP) बनाई हैं। ये सड़कें इस तरह अनुकूलित हैं कि एक विशेषज्ञ को ले जाने में लगभग कोई समय नहीं लगता।
    तथाकथित यात्रा के समय को पूरी तरह से छिपाने के लिए उन्होंने यह भी निकाला कि विशेषज्ञ पिछले प्रश्नों के काम जारी रखते हुए अगले प्रश्न पर काम शुरू कर सकें। यह एक शेफ की तरह है जो किराने का सामान उतारने वाले ड्राइवर के आने से पहले ही सब्जियां काटना शुरू कर देता है।
  • मल्टीटास्किंग: उन्होंने यह पता लगाया कि विशेषज्ञ पिछले प्रश्नों के काम जारी रखते हुए अगले प्रश्न पर काम शुरू कर सकें। यह एक शेफ की तरह है जो डिलीवरी ड्राइवर द्वारा सामान उतारने से पहले ही सब्जियां काटना शुरू कर देता है। यह यात्रा के समय को पूरी तरह से छिपा देता है।

3. द कंप्यूट एफिशिएंसी वॉल: "खाली बैठे कर्मचारी"

समस्या: क्योंकि विशेषज्ञ बहुत विशिष्ट होते हैं, इसलिए उन्हें अक्सर बहुत छोटे कार्य मिलते हैं। कल्पना कीजिए कि एक मास्टर बढ़ई को केवल एक कील ठोकने के लिए कहा गया है। वे अगले निर्देश की प्रतीक्षा करने में अपना अधिकांश समय बिताते हैं, और कंप्यूटर का "बॉस" (CPU) हर सेकंड हजारों छोटे निर्देश देने की कोशिश में अभिभूत हो जाता है। कर्मचारी खाली बैठे रहते हैं, और बॉस तनाव में रहता है।
समाधान:

  • बैचिंग (Batching): एक बढ़ई को एक कील देने के बजाय, वे 100 बढ़इयों को एक साथ समूह में देते हैं और उन्हें एक साथ पूरी दीवार बनाने का काम देते हैं। यह सभी को व्यस्त रखता है।
  • "स्क्रिप्ट" (CUDA Graphs): बॉस द्वारा एक-एक करके निर्देश चिल्लाने ("ठोकें! घिसे! पेंट करें!") के बजाय, वे निर्देशों को एक बार स्क्रिप्ट पर लिख देते हैं। फिर कर्मचारी बिना बॉस के बोलने का इंतज़ार किए स्वचालित रूप से स्क्रिप्ट का पालन करते हैं। यह "चिल्लाने" के विलंब को हटा देता है।
  • स्मार्ट शेड्यूलिंग: वे पैरेलल फोल्डिंग (Parallel Folding) नामक एक प्रणाली का उपयोग करते हैं। एक ऐसी फैक्ट्री की कल्पना करें जहाँ "पेंटिंग" (अटेंशन लेयर्स) और "लकड़ी का काम" (MoE लेयर्स) की असेंबली लाइन को पहले एक ही संख्या में श्रमिकों का उपयोग करने के लिए मजबूर किया जाता था। अब, वे लकड़ी के काम के लिए एक बड़ी टीम और पेंटिंग के लिए एक छोटी टीम रख सकते हैं, या इसके विपरीत, जो भी फैक्ट्री को उस दिन चाहिए। यह सुनिश्चित करता है कि कोई भी कभी खाली न खड़ा रहे।

परिणाम: एक सुपर-फैक्ट्री

इन तीन समस्याओं को हल करके, NVIDIA ने ऐसे मॉडल को प्रशिक्षित करने की क्षमता विकसित की है जिनमें ट्रिलियन पैरामीटर्स (जैसे DeepSeek-V3 और Qwen3) होते हैं, और वह भी अविश्वसनीय रूप से तेज़।

  • नवीनतम सुपर-कंप्यूटरों (GB300/GB200) पर: वे ऐसी गति प्राप्त कर रहे हैं जो पहले असंभव मानी जाती थी, डेटा को इतनी तेज़ी से प्रोसेस कर रहे हैं जैसे कि किसी फिल्म को फास्ट-फॉरवर्ड में देखना।
  • "सीक्रेट सॉस" (Secret Sauce): यह पेपर इस बात पर जोर देता है कि आप केवल एक समस्या को ठीक नहीं कर सकते। यदि आप मेमोरी को ठीक करते हैं लेकिन ट्रैफिक को अनदेखा करते हैं, तो आप फिर भी असफल हो जाएंगे। आपको तीनों को एक साथ ठीक करना होगा, जैसे रेस कार के इंजन, टायर और एरोडायनामिक्स को एक साथ ट्यून करना।

संक्षेप में: यह पेपर इस बात का ब्लूप्रिंट है कि कैसे विशेषज्ञों की एक विशाल, वितरित टीम बनाई जाए ताकि वे ट्रैफिक में न खो जाएं, ऑफिस में जगह की कमी न हो, या निर्देशों के लिए इंतजार करते हुए खाली न बैठें। यह एक अराजक, धीमी प्रक्रिया को एक सुव्यवस्थित, उच्च-गति वाली मशीन में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →