Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
नेमोट्रोन 3 अल्ट्रा (Nemotron 3 Ultra) एक ओपन-सोर्स, 550-बिलियन-पैरामीटर हाइब्रिड मंबा-ट्रांसफॉर्मर (Mamba-Transformer) मॉडल है जिसमें 1M-टोकन का कॉन्टेक्स्ट और उन्नत प्रशिक्षण तकनीकें हैं जो अत्याधुनिक सटीकता के साथ 6 गुना अधिक इन्फरेंस थ्रूपुट प्रदान करती है, जो इसे जटिल एजेंटिक रीजनिंग कार्यों के लिए आदर्श बनाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ Nemotron 3 Ultra पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) में विभाजित किया गया है।
बड़ी तस्वीर: "काम करने" के लिए एक सुपर-ब्रेन
कल्पना कीजिए कि आपके पास एक शानदार सहायक है। आज के अधिकांश AI सहायक चैट करने या त्वरित ईमेल लिखने में अच्छे होते हैं। Nemotron 3 Ultra को एक लंबे समय तक चलने वाले प्रोजेक्ट मैनेजर के रूप में डिज़ाइन किया गया है। इसे घंटों तक जागते रहने, कई विंडोज़ खोलने, वेब खोजने, कोड लिखने, त्रुटियों को ठीक करने और बिना आपके हाथ पकड़ने के जटिल कार्यों को अपने आप पूरा करने के लिए बनाया गया है।
पेपर का दावा है कि यह मॉडल NVIDIA का अब तक का "सबसे सक्षम" मॉडल है, जिसे भारी मात्रा में जानकारी (एक बार में 10 लाख शब्द तक) को संभालने के लिए तेज़ और कुशल होने के लिए अनुकूलित किया गया है।
1. इंजन: AI के लिए एक हाइब्रिड कार
अधिकांश AI मॉडल एक एकल, विशाल इंजन की तरह होते हैं जो हर कार्य के लिए एक ही तरह से चलते हैं। Nemotron 3 Ultra अलग है; यह एक हाइब्रिड वाहन है।
- "Mamba" इंजन: इसे एक हाई-स्पीड ट्रेन की तरह समझें। यह जानकारी के माध्यम से बहुत तेज़ी से आगे बढ़ता है और इसके पीछे भारी सामान (मेमोरी) ढोने की ज़रूरत नहीं होती। यह लंबी कहानियों या दस्तावेज़ों को प्रोसेस करने में अविश्वसनीय रूप से तेज़ है।
- "Transformer" इंजन: यह क्लासिक, शक्तिशाली इंजन है जो गहरे तर्क (reasoning) और जटिल संबंधों को समझने में बेहतरीन है।
- हाइब्रिड: मॉडल इन दोनों इंजनों के बीच कार्य के आधार पर स्विच करता है। यह लंबे दस्तावेज़ों को स्कैन करने के लिए तेज़ ट्रेन का उपयोग करता है और गहरे चिंतन के लिए शक्तिशाली इंजन का। यह संयोजन इसे अपनी बुद्धिमत्ता खोए बिना अपने प्रतिस्पर्धियों की तुलना में बहुत अधिक तेज़ बनाता है।
2. टीम संरचना: "विशेषज्ञों का मिश्रण" (Mixture of Experts)
एक विशाल पुस्तकालय की कल्पना करें। एक अकेला लाइब्रेरियन जो हर किताब के बारे में सब कुछ जानने की कोशिश कर रहा है (जो धीमा और थका देने वाला है), उसके बजाय इस पुस्तकालय में 512 विशेषज्ञ हैं।
- जब आप कानून के बारे में सवाल पूछते हैं, तो केवल कानूनी विशेषज्ञ जागते हैं।
- जब आप कोडिंग के बारे में पूछते हैं, तो केवल कोडिंग विशेषज्ञ जागते हैं।
- जब आप गणित के बारे में पूछते हैं, तो केवल गणित के विशेषज्ञ जागते हैं।
इसे Mixture-of-Experts (MoE) मॉडल कहा जाता है। Nemotron 3 Ultra में कुल 550 बिलियन "विशेषज्ञ" (पैरामीटर्स) हैं, लेकिन किसी भी एक वाक्य के लिए, यह उनमें से केवल 55 बिलियन को ही "जगाता" है। यह स्टैंडबाय पर विशेषज्ञों की एक विशाल टीम होने जैसा है, लेकिन केवल उन्हीं विशिष्ट विशेषज्ञों को बुलाना जिनकी आपको अभी ज़रूरत है। यह भारी मात्रा में ऊर्जा और समय बचाता है।
3. प्रशिक्षण: छात्र से मास्टर तक
पेपर इस मॉडल को एक विशेषज्ञ एजेंट बनाने के लिए तीन-चरणीय प्रशिक्षण प्रक्रिया का वर्णन करता है:
- चरण 1: प्री-ट्रेनिंग (विश्वकोश पढ़ना): मॉडल ने 20 ट्रिलियन टेक्स्ट टोकन (शब्द और कोड) पढ़े। यह एक विशाल पुस्तकालय की हर किताब पढ़ने जैसा है। उन्होंने इसे कुशलतापूर्वक करने के लिए एक विशेष "लो-प्रिसिजन" फॉर्मेट (NVFP4) का उपयोग किया, जैसे कि अर्थ खोए बिना एक पेज पर अधिक जानकारी फिट करने के लिए छोटे फॉन्ट में किताब पढ़ना।
- चरण 2: सुपरवाइज्ड फाइन-ट्यूनिंग (इंटर्नशिप): मॉडल को निर्देश मानने, टूल्स (जैसे सर्च इंजन या कोड टर्मिनल) का उपयोग करने और सुरक्षित रहने के बारे में सिखाया गया। उन्होंने इसे समस्या को चरण-दर-चरण हल करने के उदाहरण दिए।
- चरण 3: रीइन्फोर्समेंट लर्निंग और डिस्टिलेशन (मास्टरक्लास): यही असली सीक्रेट सॉस है।
- पहले, मॉडल ने कोडिंग, गणित और ऑफिस वर्क जैसे विभिन्न "सिमुलेशन" (जैसे वीडियो गेम) में अभ्यास किया ताकि वह ट्रायल और एरर से सीख सके।
- फिर, उन्होंने 10+ विशिष्ट "टीचर" मॉडल (एक कोडिंग के लिए, एक गणित के लिए, एक ऑफिस वर्क के लिए, आदि) को प्रशिक्षित किया।
- अंत में, उन्होंने एक तकनीक MOPD (Multi-teacher On-Policy Distillation) का उपयोग किया। कल्पना कीजिए कि मुख्य मॉडल (छात्र) एक समस्या को हल करने की कोशिश कर रहा है, और विशेषज्ञ शिक्षक उसे ठीक से करने के तरीके पर सलाह दे रहे हैं। छात्र शिक्षकों की बेहतरीन चालों की नकल करके सीखता है, और उनकी सारी बुद्धिमत्ता को एक सुपर-मॉडल में मिला देता है।
4. सुपरपावर्स
पेपर उन तीन मुख्य सुपरपावर्स पर प्रकाश डालता है जो Nemotron 3 Ultra के पास हैं:
- 10 लाख शब्दों की मेमोरी: अधिकांश AI मॉडल भ्रमित हो जाते हैं यदि आप उन्हें कुछ अध्यायों से लंबी किताब देते हैं। Nemotron 1-मिलियन-टोकन का कॉन्टेक्स्ट (लगभग 10 पूर्ण उपन्यासों के आकार का) पढ़ सकता है और अंतिम पृष्ठ लिखते समय भी पहले पृष्ठ के विवरण को याद रख सकता है।
- "रीजनिंग बजट" नियंत्रण: आप मॉडल को बता सकते हैं, "इसे जल्दी से हल करें लेकिन शायद कुछ स्टेप्स छोड़ दें," या "अपना समय लें और गहराई से सोचें।" यह उपयोगकर्ताओं को कार्य के आधार पर गति और सटीकता के बीच चयन करने की अनुमति देता है।
- गति: अपने हाइब्रिड इंजन और विशेषज्ञ प्रणाली के कारण, यह अन्य शीर्ष-स्तरीय सार्वजनिक मॉडलों की तुलना में 6 गुना अधिक तेज़ जानकारी प्रोसेस कर सकता है जबकि समान (या बेहतर) उत्तर देता है।
5. "ब्रेन" की स्थिरता
पेपर स्वीकार करता है कि इतने बड़े मॉडल को प्रशिक्षित करना एक रस्सी पर चलने (tightrope walking) जैसा है। प्रशिक्षण के दौरान उन्हें दो बार "डाइवर्जेंस" (जहाँ मॉडल अजीब और गलत अनुमान लगाने लगता है) का सामना करना पड़ा।
- फिक्स 1: उन्होंने महसूस किया कि गणित का एक विशिष्ट हिस्सा (ग्रेडिएंट एक्यूमुलेशन) अपनी शुद्धता (precision) खो रहा था, इसलिए उन्होंने उस हिस्से के लिए उच्च-परिशुद्धता मोड पर वापस जाने का निर्णय लिया।
- फिक्स 2: उन्होंने देखा कि टीम के "विशेषज्ञ" असंतुलित हो रहे थे (कुछ सारा काम कर रहे थे, जबकि अन्य सो रहे थे)। उन्होंने यह सुनिश्चित करने के लिए सिस्टम को समायोजित किया कि कार्यभार समान रूप से साझा किया जाए, जिससे मॉडल के क्रैश होने की संभावना कम हो गई।
6. परिणाम: सबके लिए खुला
सबसे रोमांचक हिस्सा यह है कि NVIDIA सब कुछ ओपन-सोर्स कर रहा है।
- वे Base model (कच्चा दिमाग) रिलीज़ कर रहे हैं।
- Post-trained model (विशेषज्ञ एजेंट) रिलीज़ कर रहे हैं।
- एक Quantized version (एक संपीड़ित संस्करण जो विशिष्ट NVIDIA चिप्स पर और भी तेज़ी से चलता है) रिलीज़ कर रहे हैं।
- Data and Recipes (उन किताबों की सटीक सूची जिन्हें उन्होंने पढ़ा और उन निर्देशों का पालन किया जिनका उन्होंने अनुसरण किया) भी उपलब्ध करा रहे हैं।
संक्षेप में: Nemotron 3 Ultra एक विशाल, हाइब्रिड-इंजन वाला AI है जिसे एक लंबे समय तक चलने वाले, स्वायत्त कार्यकर्ता के रूप में डिज़ाइन किया गया है। यह गहराई से सोचने लेकिन तेज़ी से चलने के लिए विशेषज्ञ पेशेवरों की एक टीम का उपयोग करता है, यह टेक्स्ट की पूरी लाइब्रेरी को याद रख सकता है, और इसे सार्वजनिक रूप से जारी किया जा रहा है ताकि कोई भी इसके साथ अपना खुद का AI एजेंट बना सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।