← नवीनतम पेपर
💬 NLP

Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation

नेमोट्रॉन-कैस्केड 2 (Nemotron-Cascade 2) एक कॉम्पैक्ट 30B MoE मॉडल है जो उन्नत कैस्केड RL और मल्टी-डोमेन ऑन-पॉलिसी डिस्टिलेशन के माध्यम से गणित, इन्फॉर्मेटिक्स और प्रतिस्पर्धी प्रोग्रामिंग में गोल्ड मेडल-स्तर का प्रदर्शन प्राप्त करता है, जो बड़े फ्रंटियर मॉडलों की तुलना में 20 गुना अधिक इंटेलिजेंस डेंसिटी प्रदान करता है।

मूल लेखक: Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi
प्रकाशित 2026-03-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, युवा प्रशिक्षु है जिसका नाम Nemotron-Cascade 2 है। यह प्रशिक्षु एक "लार्ज लैंग्वेज मॉडल" (LLM) है—मूल रूप से एक सुपर-स्मार्ट कंप्यूटर मस्तिष्क जो लिख सकता है, कोड कर सकता है, गणित की समस्याओं को हल कर सकता है, और एक डिजिटल सहायक की तरह कार्य कर सकता है।

इसे क्या खास बनाता है वह केवल इसका विशाल मस्तिष्क नहीं है (वास्तव में, यह काफी संक्षिप्त है, जिसमें केवल 30 बिलियन "न्यूरॉन्स" हैं, जबकि इसके प्रतिद्वंद्वियों के पास सैकड़ों अरब न्यूरॉन्स हैं), बल्कि यह है कि इसे कैसे प्रशिक्षित किया गया

यहाँ इस कहानी का विवरण है कि कैसे यह प्रशिक्षु एक स्वर्ण पदक विजेता बना, जिसे सरल भाषा में समझाया गया है।

1. समस्या: "जैक ऑफ ऑल ट्रेड्स" (सब कुछ करने वाला) की दुविधा

कल्पना कीजिए कि आप एक छात्र को एक साथ विश्व स्तरीय गणितज्ञ, कोडिंग जादूगर और एक विनम्र ग्राहक सेवा एजेंट बनने के लिए प्रशिक्षित करना चाहते हैं।

  • यदि आप उन्हें पहले गणित सिखाते हैं, तो वे विनम्र होना भूल सकते हैं।
  • यदि आप उन्हें इसके बाद कोडिंग सिखाते हैं, तो वे गणित भूल सकते हैं।
  • यदि आप सब कुछ एक ही समय में सिखाने की कोशिश करते हैं, तो वे भ्रमित हो जाते हैं और कुछ भी ठीक से नहीं सीख पाते।

यह अधिकांश AI प्रशिक्षण की समस्या है। यह एक पहिये पर साइकिल चलाते हुए जोंगरबाजी (juggling) करने जैसा है; आमतौर पर आप कुछ न कुछ गिरा ही देते हैं।

2. समाधान: "कैस्केड" (Cascade) प्रशिक्षण पद्धति

NVIDIA के शोधकर्ताओं ने एक नई प्रशिक्षण शैली पेश की जिसे Cascade RL (रीइन्फोर्समेंट लर्निंग) कहा जाता है। इसे एक विशेष स्पोर्ट्स ट्रेनिंग कैंप के रूप में समझें।

छात्र को एक साथ सब कुछ करने के बजाय, वे उन्हें एक विशिष्ट क्रम में प्रशिक्षित करते हैं, जैसे कि वीडियो गेम के स्तर (levels):

  1. स्तर 1: निर्देश पालन (Instruction Following)। पहले, छात्र सुनना सीखता है। "जैसा मैं कहूँ बिल्कुल वैसा ही करो, न इससे ज्यादा, न इससे कम।"
  2. स्तर 2: बहु-डोमेन कौशल (Multi-Domain Skills)। इसके बाद, वे उपकरणों (जैसे कैलकुलेटर या कोड एडिटर) का उपयोग करना और विज्ञान की समस्याओं को हल करना सीखते हैं।
  3. स्तर 3: "डिस्टिलेशन" सुरक्षा जाल (The "Distillation" Safety Net)। यह असली गुप्त नुस्खा है। हर कुछ स्तरों के बाद, छात्र को एक "शिक्षक" (उनका पिछला संस्करण जो किसी विशिष्ट कार्य में उत्कृष्ट था) के साथ जोड़ा जाता है। छात्र अपने शिक्षक की सबसे अच्छी आदतों की नकल करता है ताकि वह जो पहले सीखा है उसे भूल न जाए। यह एक छात्र द्वारा कठिन अध्याय पर जाने से पहले अपने पुराने नोट्स दोहराने जैसा है।
  4. स्तर 4: मानव संरेखण (Human Alignment)। अंत में, वे एक अच्छे मानव सहायक की तरह मददगार, हानिरहित और रचनात्मक बनना सीखते हैं।

3. "ऑन-पॉलिसी डिस्टिलेशन" (याददाश्त का गद्दा)

AI प्रशिक्षण में सबसे बड़ा जोखिम कैटास्ट्रॉफिक फॉरगेटिंग (विनाशकारी विस्मृति) है। कल्पना कीजिए कि आप पियानो बजाना सीख रहे हैं, फिर वायलिन बजाना सीखते हैं, और अचानक आप पियानो के कॉर्ड्स भूल जाते हैं।

शोधकर्ताओं ने मल्टी-डोमेन ऑन-पॉलिसी डिस्टिलेशन (MOPD) नामक एक तकनीक जोड़ी।

  • उपमा: कल्पना कीजिए कि छात्र मैराथन दौड़ रहा है। हर बार जब वह थक जाता है और उसका फॉर्म बिगड़ने लगता है (पुराने कौशल भूलने लगता है), तो एक कोच (शिक्षक) उसके साथ दौड़ता है, उसे दिखाता है कि अपने हाथ कैसे पकड़ने हैं और सांस कैसे लेनी है। छात्र तुरंत कोच के सटीक फॉर्म की नकल करता है।
  • परिणाम: छात्र नए क्षेत्रों (जैसे कठिन गणितीय प्रमाणों) में मजबूत होता है, बिना बुनियादी चीजों (जैसे एक विनम्र ईमेल लिखना) को खोए।

4. परिणाम: "स्वर्ण पदक" प्रदर्शन

इस स्मार्ट प्रशिक्षण पद्धति के कारण, Nemotron-Cascade 2 एक 30-बिलियन पैरामीटर मॉडल (एक छोटा, कुशल मस्तिष्क) है जो एक 300-बिलियन पैरामीटर दिग्गज (एक विशाल मस्तिष्क) की तरह प्रदर्शन करता है।

  • ओलंपिक: 2025 में, इस मॉडल ने इंटरनेशनल मैथमैटिकल ओलंपियाड (IMO) और इंटरनेशनल ओलंपियाड इन इन्फॉर्मेटिक्स (IOI) में प्रतिस्पर्धा की। ये दुनिया भर के हाई स्कूल छात्रों के लिए सबसे कठिन गणित और कोडिंग प्रतियोगिताएं हैं।
  • स्कोर: यह केवल पास ही नहीं हुआ; इसने स्वर्ण पदक जीते। इसने उन समस्याओं को हल किया जिनके लिए आमतौर पर पीएचडी स्तर के गणितज्ञ या शीर्ष स्तर के कंप्यूटर वैज्ञानिक की आवश्यकता होती है।
  • दक्षता: इसने पिछले रिकॉर्ड धारकों की तुलना में 20 गुना कम पैरामीटर्स के साथ यह उपलब्धि हासिल की। यह एक विशाल सेमी-ट्रक के मुकाबले दौड़ जीतने वाली एक छोटी स्पोर्ट्स कार की तरह है।

5. यह क्यों महत्वपूर्ण है

  • छोटा बेहतर है: अब जटिल समस्याओं को हल करने के लिए आपको इमारत के आकार के सुपरकंप्यूटर की आवश्यकता नहीं है। यह मॉडल कम हार्डवेयर पर चलने के लिए पर्याप्त कुशल है।
  • ओपन सोर्स: रचनाकारों ने अपना गुप्त नुस्खा छिपाया नहीं। उन्होंने मॉडल, प्रशिक्षण डेटा और विधियों को सभी के उपयोग के लिए जारी किया। यह दुनिया को एक आदर्श केक बनाने की रेसिपी देने जैसा है, न कि केवल केक बेचने जैसा।
  • वास्तविक दुनिया के कौशल: यह केवल गणित में अच्छा नहीं है; यह कोड लिखने, सॉफ्टवेयर डीबग करने और एक सहायक एजेंट के रूप में कार्य करने में भी बेहतरीन है जो काम पूरा करने के लिए उपकरणों का उपयोग कर सकता है।

संक्षेप में

Nemotron-Cascade 2 एक छोटा, अत्यधिक कुशल AI है जिसने एक सख्त, चरण-दर-चरण "कैस्केड" क्रम में प्रशिक्षण प्राप्त करके जीनियस बनना सीखा, और यह सुनिश्चित करने के लिए कि यह कभी कोई कौशल न भूले कि यह लगातार अपने पिछले सर्वश्रेष्ठ प्रदर्शनों के विरुद्ध अपने काम की जांच करता रहता है। परिणाम एक ऐसा मॉडल है जो अपने वजन से कहीं अधिक प्रभावशाली प्रदर्शन करता है, गणित और कोडिंग में स्वर्ण पदक जीतता है, जबकि छोटा और तेज़ बना रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →