Scalable Training of Mixture-of-Experts Models with Megatron Core
यह शोध पत्र मेग्रोटन कोर (Megatron Core) प्रस्तुत करता है, जो एक स्केलेबल और प्रोडक्शन-रेडी ओपन-सोर्स फ्रेमवर्क है जो एकीकृत सिस्टम-स्तरीय अनुकूलन के माध्यम से मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) प्रशिक्षण की युग्मित मेमोरी, संचार और गणना संबंधी चुनौतियों का समाधान करता है, जिससे बड़े पैमाने के GPU क्लस्टर्स पर अरबों से लेकर ट्रिलियन पैरामीटर्स तक के मॉडल्स का उच्च-प्रदर्शन प्रशिक्षण सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, अति-बुद्धिमान मस्तिष्क (एक लार्ज लैंग्वेज मॉडल) बनाने की कोशिश कर रहे हैं ताकि जटिल समस्याओं को हल किया जा सके। अतीत में, इस मस्तिष्क को और स्मार्ट बनाने के लिए, आप इसे बस बड़ा और भारी बना देते थे, जैसे दीवार में और अधिक ईंटें जोड़ना। लेकिन इससे यह मस्तिष्क अविश्वसनीय रूप से धीमा और महंगा हो जाता था क्योंकि हर एक विचार के लिए हर एक ईंट का काम करना आवश्यक होता था।
मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) एक क्रांतिकारी नया तरीका है जिससे इस मस्तिष्क का निर्माण किया जाता है। एक विशाल मस्तिष्क के बजाय, एक विशेषज्ञ सलाहकारों (Experts) की एक टीम की कल्पना करें (100 विशेषज्ञ)। जब आप कोई प्रश्न पूछते हैं, तो एक मैनेजर (रौटर) उन सभी 100 विशेषज्ञों को नहीं जगाता। इसके बजाय, वह उन शीर्ष 2 या 3 विशेषज्ञों को चुनता है जो उस विशिष्ट विषय के लिए सबसे अच्छे हैं और केवल उन्हें ही काम करने के लिए कहता है।
यह अद्भुत है क्योंकि मस्तिष्क बहुत बड़ा (लाखों विशेषज्ञ) हो सकता है, लेकिन यह प्रत्येक प्रश्न के लिए केवल एक छोटे से हिस्से का ही उपयोग करता है। यह एक ऐसी लाइब्रेरी की तरह है जिसमें लाखों किताबें हैं, लेकिन आप केवल वही दो किताबें निकालते हैं जिनकी आपको उस क्षण आवश्यकता है।
हालाँकि, इस प्रणाली को प्रशिक्षित करना एक लॉजिस्टिक दुःस्वप्न है। NVIDIA का नया पेपर, "Scalable Training of Mixture-of-Experts Models with Megatron Core," वास्तव में इस विशाल सलाहकार टीम को कुशलतापूर्वक चलाने के लिए एक परम संचालन मैनुअल (operations manual) है। वे जिन समस्याओं को हल किया है, उन्हें "थ्री वॉल्स" (तीन दीवारें) कहते हैं।
यहाँ बताया गया है कि उन्होंने इन दीवारों को कैसे तोड़ा, सरल शब्दों में:
1. द मेमोरी वॉल: "फिटिंग रूम की समस्या"
समस्या: भले ही एक समय में केवल कुछ ही विशेषज्ञ काम करते हैं, लेकिन सभी 100 विशेषज्ञों को कमरे (GPU मेमोरी) में मौजूद होना चाहिए, यदि आवश्यकता पड़े। यदि आपके पास दस लाख विशेषज्ञ हैं, तो कमरा उनके बायोडाटा और उपकरणों से इतना भर जाएगा कि आप उन सभी को फिट नहीं कर पाएंगे।
समाधान:
- कंप्रेशन (संपीड़न): उन्होंने विशेषज्ञों को हल्के बैकपैक ले जाने के लिए प्रशिक्षित किया (FP8/FP4 प्रिसिजन का उपयोग करके)। विस्तृत ब्लूप्रिंट ले जाने के बजाय, वे सरलीकृत रेखाचित्र ले जाते हैं जो 50% से 75% तक छोटे होते हैं लेकिन काम पूरा कर देते हैं।
- "डू-इट-योरसेल्फ" ट्रिक: विशेषज्ञों के काम के हर एक चरण को कमरे में स्टोर करने के बजाय, वे नोट्स को फेंक देते हैं और बाद में आवश्यकता पड़ने पर विशेषज्ञों को चरणों को पुनः गणना (re-calculate) करने के लिए कहते हैं। इसमें पुन: गणना करने में थोड़ा अधिक समय लगता है, लेकिन यह स्थान की भारी बचत करता है।
- अटारी (The Attic): जिस चीज़ की उन्हें अभी आवश्यकता नहीं है, उसे वे अटारी (CPU मेमोरी) में भेज देते हैं और जब बिल्कुल आवश्यक हो तभी उसे नीचे लाते हैं।
2. द कम्युनिकेशन वॉल: "ट्रैफिक जाम"
समस्या: चूंकि मैनेजर अलग-अलग प्रश्नों के लिए अलग-अलग विशेषज्ञों को चुनता है, इसलिए विशेषज्ञ अलग-अलग इमारतों (GPUs) में बिखरे हुए होते हैं। जब कोई प्रश्न आता है, तो मैनेजर को इधर-उधर दौड़ना पड़ता है, सही विशेषज्ञों को पकड़ना पड़ता है, उन्हें काम की मेज पर लाना पड़ता है, और फिर उन्हें वापस भेजना पड़ता है। यदि आपके पास हजारों इमारतें हैं, तो घूमने में बिताया गया समय (कम्युनिकेशन) वास्तव में काम करने के समय से अधिक लंबा हो जाता है।
समाधान:
- सुपर-हाईवे: उन्होंने इन विशेषज्ञों को ले जाने के लिए विशेष, अत्यंत तेज़ सड़कें (DeepEP और HybridEP) बनाई हैं। ये सड़कें इस तरह अनुकूलित हैं कि एक विशेषज्ञ को ले जाने में लगभग कोई समय नहीं लगता।
तथाकथित यात्रा के समय को पूरी तरह से छिपाने के लिए उन्होंने यह भी निकाला कि विशेषज्ञ पिछले प्रश्नों के काम जारी रखते हुए अगले प्रश्न पर काम शुरू कर सकें। यह एक शेफ की तरह है जो किराने का सामान उतारने वाले ड्राइवर के आने से पहले ही सब्जियां काटना शुरू कर देता है। - मल्टीटास्किंग: उन्होंने यह पता लगाया कि विशेषज्ञ पिछले प्रश्नों के काम जारी रखते हुए अगले प्रश्न पर काम शुरू कर सकें। यह एक शेफ की तरह है जो डिलीवरी ड्राइवर द्वारा सामान उतारने से पहले ही सब्जियां काटना शुरू कर देता है। यह यात्रा के समय को पूरी तरह से छिपा देता है।
3. द कंप्यूट एफिशिएंसी वॉल: "खाली बैठे कर्मचारी"
समस्या: क्योंकि विशेषज्ञ बहुत विशिष्ट होते हैं, इसलिए उन्हें अक्सर बहुत छोटे कार्य मिलते हैं। कल्पना कीजिए कि एक मास्टर बढ़ई को केवल एक कील ठोकने के लिए कहा गया है। वे अगले निर्देश की प्रतीक्षा करने में अपना अधिकांश समय बिताते हैं, और कंप्यूटर का "बॉस" (CPU) हर सेकंड हजारों छोटे निर्देश देने की कोशिश में अभिभूत हो जाता है। कर्मचारी खाली बैठे रहते हैं, और बॉस तनाव में रहता है।
समाधान:
- बैचिंग (Batching): एक बढ़ई को एक कील देने के बजाय, वे 100 बढ़इयों को एक साथ समूह में देते हैं और उन्हें एक साथ पूरी दीवार बनाने का काम देते हैं। यह सभी को व्यस्त रखता है।
- "स्क्रिप्ट" (CUDA Graphs): बॉस द्वारा एक-एक करके निर्देश चिल्लाने ("ठोकें! घिसे! पेंट करें!") के बजाय, वे निर्देशों को एक बार स्क्रिप्ट पर लिख देते हैं। फिर कर्मचारी बिना बॉस के बोलने का इंतज़ार किए स्वचालित रूप से स्क्रिप्ट का पालन करते हैं। यह "चिल्लाने" के विलंब को हटा देता है।
- स्मार्ट शेड्यूलिंग: वे पैरेलल फोल्डिंग (Parallel Folding) नामक एक प्रणाली का उपयोग करते हैं। एक ऐसी फैक्ट्री की कल्पना करें जहाँ "पेंटिंग" (अटेंशन लेयर्स) और "लकड़ी का काम" (MoE लेयर्स) की असेंबली लाइन को पहले एक ही संख्या में श्रमिकों का उपयोग करने के लिए मजबूर किया जाता था। अब, वे लकड़ी के काम के लिए एक बड़ी टीम और पेंटिंग के लिए एक छोटी टीम रख सकते हैं, या इसके विपरीत, जो भी फैक्ट्री को उस दिन चाहिए। यह सुनिश्चित करता है कि कोई भी कभी खाली न खड़ा रहे।
परिणाम: एक सुपर-फैक्ट्री
इन तीन समस्याओं को हल करके, NVIDIA ने ऐसे मॉडल को प्रशिक्षित करने की क्षमता विकसित की है जिनमें ट्रिलियन पैरामीटर्स (जैसे DeepSeek-V3 और Qwen3) होते हैं, और वह भी अविश्वसनीय रूप से तेज़।
- नवीनतम सुपर-कंप्यूटरों (GB300/GB200) पर: वे ऐसी गति प्राप्त कर रहे हैं जो पहले असंभव मानी जाती थी, डेटा को इतनी तेज़ी से प्रोसेस कर रहे हैं जैसे कि किसी फिल्म को फास्ट-फॉरवर्ड में देखना।
- "सीक्रेट सॉस" (Secret Sauce): यह पेपर इस बात पर जोर देता है कि आप केवल एक समस्या को ठीक नहीं कर सकते। यदि आप मेमोरी को ठीक करते हैं लेकिन ट्रैफिक को अनदेखा करते हैं, तो आप फिर भी असफल हो जाएंगे। आपको तीनों को एक साथ ठीक करना होगा, जैसे रेस कार के इंजन, टायर और एरोडायनामिक्स को एक साथ ट्यून करना।
संक्षेप में: यह पेपर इस बात का ब्लूप्रिंट है कि कैसे विशेषज्ञों की एक विशाल, वितरित टीम बनाई जाए ताकि वे ट्रैफिक में न खो जाएं, ऑफिस में जगह की कमी न हो, या निर्देशों के लिए इंतजार करते हुए खाली न बैठें। यह एक अराजक, धीमी प्रक्रिया को एक सुव्यवस्थित, उच्च-गति वाली मशीन में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।