Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
नेमोट्रॉन-कैस्केड 2 (Nemotron-Cascade 2) एक कॉम्पैक्ट 30B MoE मॉडल है जो उन्नत कैस्केड RL और मल्टी-डोमेन ऑन-पॉलिसी डिस्टिलेशन के माध्यम से गणित, इन्फॉर्मेटिक्स और प्रतिस्पर्धी प्रोग्रामिंग में गोल्ड मेडल-स्तर का प्रदर्शन प्राप्त करता है, जो बड़े फ्रंटियर मॉडलों की तुलना में 20 गुना अधिक इंटेलिजेंस डेंसिटी प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, युवा प्रशिक्षु है जिसका नाम Nemotron-Cascade 2 है। यह प्रशिक्षु एक "लार्ज लैंग्वेज मॉडल" (LLM) है—मूल रूप से एक सुपर-स्मार्ट कंप्यूटर मस्तिष्क जो लिख सकता है, कोड कर सकता है, गणित की समस्याओं को हल कर सकता है, और एक डिजिटल सहायक की तरह कार्य कर सकता है।
इसे क्या खास बनाता है वह केवल इसका विशाल मस्तिष्क नहीं है (वास्तव में, यह काफी संक्षिप्त है, जिसमें केवल 30 बिलियन "न्यूरॉन्स" हैं, जबकि इसके प्रतिद्वंद्वियों के पास सैकड़ों अरब न्यूरॉन्स हैं), बल्कि यह है कि इसे कैसे प्रशिक्षित किया गया।
यहाँ इस कहानी का विवरण है कि कैसे यह प्रशिक्षु एक स्वर्ण पदक विजेता बना, जिसे सरल भाषा में समझाया गया है।
1. समस्या: "जैक ऑफ ऑल ट्रेड्स" (सब कुछ करने वाला) की दुविधा
कल्पना कीजिए कि आप एक छात्र को एक साथ विश्व स्तरीय गणितज्ञ, कोडिंग जादूगर और एक विनम्र ग्राहक सेवा एजेंट बनने के लिए प्रशिक्षित करना चाहते हैं।
- यदि आप उन्हें पहले गणित सिखाते हैं, तो वे विनम्र होना भूल सकते हैं।
- यदि आप उन्हें इसके बाद कोडिंग सिखाते हैं, तो वे गणित भूल सकते हैं।
- यदि आप सब कुछ एक ही समय में सिखाने की कोशिश करते हैं, तो वे भ्रमित हो जाते हैं और कुछ भी ठीक से नहीं सीख पाते।
यह अधिकांश AI प्रशिक्षण की समस्या है। यह एक पहिये पर साइकिल चलाते हुए जोंगरबाजी (juggling) करने जैसा है; आमतौर पर आप कुछ न कुछ गिरा ही देते हैं।
2. समाधान: "कैस्केड" (Cascade) प्रशिक्षण पद्धति
NVIDIA के शोधकर्ताओं ने एक नई प्रशिक्षण शैली पेश की जिसे Cascade RL (रीइन्फोर्समेंट लर्निंग) कहा जाता है। इसे एक विशेष स्पोर्ट्स ट्रेनिंग कैंप के रूप में समझें।
छात्र को एक साथ सब कुछ करने के बजाय, वे उन्हें एक विशिष्ट क्रम में प्रशिक्षित करते हैं, जैसे कि वीडियो गेम के स्तर (levels):
- स्तर 1: निर्देश पालन (Instruction Following)। पहले, छात्र सुनना सीखता है। "जैसा मैं कहूँ बिल्कुल वैसा ही करो, न इससे ज्यादा, न इससे कम।"
- स्तर 2: बहु-डोमेन कौशल (Multi-Domain Skills)। इसके बाद, वे उपकरणों (जैसे कैलकुलेटर या कोड एडिटर) का उपयोग करना और विज्ञान की समस्याओं को हल करना सीखते हैं।
- स्तर 3: "डिस्टिलेशन" सुरक्षा जाल (The "Distillation" Safety Net)। यह असली गुप्त नुस्खा है। हर कुछ स्तरों के बाद, छात्र को एक "शिक्षक" (उनका पिछला संस्करण जो किसी विशिष्ट कार्य में उत्कृष्ट था) के साथ जोड़ा जाता है। छात्र अपने शिक्षक की सबसे अच्छी आदतों की नकल करता है ताकि वह जो पहले सीखा है उसे भूल न जाए। यह एक छात्र द्वारा कठिन अध्याय पर जाने से पहले अपने पुराने नोट्स दोहराने जैसा है।
- स्तर 4: मानव संरेखण (Human Alignment)। अंत में, वे एक अच्छे मानव सहायक की तरह मददगार, हानिरहित और रचनात्मक बनना सीखते हैं।
3. "ऑन-पॉलिसी डिस्टिलेशन" (याददाश्त का गद्दा)
AI प्रशिक्षण में सबसे बड़ा जोखिम कैटास्ट्रॉफिक फॉरगेटिंग (विनाशकारी विस्मृति) है। कल्पना कीजिए कि आप पियानो बजाना सीख रहे हैं, फिर वायलिन बजाना सीखते हैं, और अचानक आप पियानो के कॉर्ड्स भूल जाते हैं।
शोधकर्ताओं ने मल्टी-डोमेन ऑन-पॉलिसी डिस्टिलेशन (MOPD) नामक एक तकनीक जोड़ी।
- उपमा: कल्पना कीजिए कि छात्र मैराथन दौड़ रहा है। हर बार जब वह थक जाता है और उसका फॉर्म बिगड़ने लगता है (पुराने कौशल भूलने लगता है), तो एक कोच (शिक्षक) उसके साथ दौड़ता है, उसे दिखाता है कि अपने हाथ कैसे पकड़ने हैं और सांस कैसे लेनी है। छात्र तुरंत कोच के सटीक फॉर्म की नकल करता है।
- परिणाम: छात्र नए क्षेत्रों (जैसे कठिन गणितीय प्रमाणों) में मजबूत होता है, बिना बुनियादी चीजों (जैसे एक विनम्र ईमेल लिखना) को खोए।
4. परिणाम: "स्वर्ण पदक" प्रदर्शन
इस स्मार्ट प्रशिक्षण पद्धति के कारण, Nemotron-Cascade 2 एक 30-बिलियन पैरामीटर मॉडल (एक छोटा, कुशल मस्तिष्क) है जो एक 300-बिलियन पैरामीटर दिग्गज (एक विशाल मस्तिष्क) की तरह प्रदर्शन करता है।
- ओलंपिक: 2025 में, इस मॉडल ने इंटरनेशनल मैथमैटिकल ओलंपियाड (IMO) और इंटरनेशनल ओलंपियाड इन इन्फॉर्मेटिक्स (IOI) में प्रतिस्पर्धा की। ये दुनिया भर के हाई स्कूल छात्रों के लिए सबसे कठिन गणित और कोडिंग प्रतियोगिताएं हैं।
- स्कोर: यह केवल पास ही नहीं हुआ; इसने स्वर्ण पदक जीते। इसने उन समस्याओं को हल किया जिनके लिए आमतौर पर पीएचडी स्तर के गणितज्ञ या शीर्ष स्तर के कंप्यूटर वैज्ञानिक की आवश्यकता होती है।
- दक्षता: इसने पिछले रिकॉर्ड धारकों की तुलना में 20 गुना कम पैरामीटर्स के साथ यह उपलब्धि हासिल की। यह एक विशाल सेमी-ट्रक के मुकाबले दौड़ जीतने वाली एक छोटी स्पोर्ट्स कार की तरह है।
5. यह क्यों महत्वपूर्ण है
- छोटा बेहतर है: अब जटिल समस्याओं को हल करने के लिए आपको इमारत के आकार के सुपरकंप्यूटर की आवश्यकता नहीं है। यह मॉडल कम हार्डवेयर पर चलने के लिए पर्याप्त कुशल है।
- ओपन सोर्स: रचनाकारों ने अपना गुप्त नुस्खा छिपाया नहीं। उन्होंने मॉडल, प्रशिक्षण डेटा और विधियों को सभी के उपयोग के लिए जारी किया। यह दुनिया को एक आदर्श केक बनाने की रेसिपी देने जैसा है, न कि केवल केक बेचने जैसा।
- वास्तविक दुनिया के कौशल: यह केवल गणित में अच्छा नहीं है; यह कोड लिखने, सॉफ्टवेयर डीबग करने और एक सहायक एजेंट के रूप में कार्य करने में भी बेहतरीन है जो काम पूरा करने के लिए उपकरणों का उपयोग कर सकता है।
संक्षेप में
Nemotron-Cascade 2 एक छोटा, अत्यधिक कुशल AI है जिसने एक सख्त, चरण-दर-चरण "कैस्केड" क्रम में प्रशिक्षण प्राप्त करके जीनियस बनना सीखा, और यह सुनिश्चित करने के लिए कि यह कभी कोई कौशल न भूले कि यह लगातार अपने पिछले सर्वश्रेष्ठ प्रदर्शनों के विरुद्ध अपने काम की जांच करता रहता है। परिणाम एक ऐसा मॉडल है जो अपने वजन से कहीं अधिक प्रभावशाली प्रदर्शन करता है, गणित और कोडिंग में स्वर्ण पदक जीतता है, जबकि छोटा और तेज़ बना रहता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।