Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding
यह शोध पत्र Nemotron-Labs-Diffusion को प्रस्तुत करता है, जो एक त्रि-मोड (tri-mode) भाषा मॉडल है जो विभिन्न मॉडल स्केल्स और परिनियोजन सेटिंग्स में इन विधियों की पूरक शक्तियों का लाभ उठाकर बेहतर थ्रूपुट और सटीकता प्राप्त करने के लिए एक ही आर्किटेक्चर के भीतर ऑटोरेग्रेसिव (autoregressive), डिफ्यूजन (diffusion) और सेल्फ-स्पेक्टुलेशन (self-speculation) डिकोडिंग को एकीकृत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपके पास इसे करने के दो अलग-अलग तरीके हैं।
पुराना तरीका (ऑटोरेग्रेसिव - Autoregressive): यह एक वाक्य को एक बार में एक शब्द करके, पूरी तरह से बाएं से दाएं लिखने जैसा है। आप "The" लिखते हैं, फिर आप सोचते हैं, "अगला क्या आता है?" और "cat" लिखते हैं। फिर आप सोचते हैं, "अगला क्या आता है?" और "sat" लिखते हैं। यह बहुत सटीक है और व्याकरण के नियमों का पूरी तरह से पालन करता है, लेकिन यह धीमा है क्योंकि आप अगला शब्द नहीं लिख सकते जब तक कि आप वर्तमान शब्द को पूरा न कर लें। यह एक अकेले व्यक्ति के कीबोर्ड पर टाइप करने जैसा है, जो प्रत्येक कीस्ट्रोक के रजिस्टर होने का इंतज़ार करता है।
नया तरीका (डिफ्यूजन - Diffusion): यह एक बिखरे हुए ड्राफ्ट जैसा है जहाँ आपने एक ही बार में पूरा पैराग्राफ लिख दिया है, लेकिन कुछ शब्द गायब हैं या इधर-उधर हो गए हैं। फिर आप एक ही समय में सभी गायब शब्दों को ठीक करते हैं। यह बहुत तेज़ है क्योंकि आप एक साथ कई शब्दों पर काम कर रहे हैं। हालाँकि, क्योंकि आप सख्त बाएं-से-दाएं के नियमों का पालन नहीं कर रहे हैं, इसलिए कहानी कभी-कभी कम समझ में आती है या थोड़ी अजीब लगती है।
पेपर का बड़ा विचार:
NVIDIA के शोधकर्ताओं ने एक "सुपर-मॉडल" बनाया जिसे Nemotron-Labs-Diffusion कहा जाता है। इस मॉडल को एक स्विस आर्मी नाइफ (Swiss Army Knife) की तरह समझें जो एक ही मस्तिष्क के भीतर, स्थिति के आधार पर तीन अलग-अलग मोड के बीच स्विच कर सकता है।
तीन मोड
"सख्त लेखक" मोड ("Strict Writer" Mode - AR Mode):
- यह कैसे काम करता है: यह बिल्कुल पुराने, धीमे तरीके की तरह काम करता है। यह एक के बाद एक एक शब्द लिखता है।
- कब उपयोग करें: जब एक ही समय में कहानियों के लिए लोगों की भारी भीड़ आपसे पूछ रही हो (हाई कंकरेंसी)। यह विश्वसनीय है और व्याकरण को एकदम सही रखता है।
- पेपर का दावा: यह मॉडल मौजूदा बेहतरीन मॉडल्स की तरह ही सटीक वाक्य लिखने में सक्षम है, भले ही इसे अन्य मोड भी पता हों।
"तेज़ सुधारक" मोड ("Fast Fixer" Mode - Diffusion Mode):
- यह कैसे काम करता है: यह एक साथ कई शब्दों का अनुमान लगाता है और उन्हें समानांतर (parallel) रूप से ठीक करता है।
- कब उपयोग करें: जब आपको गति की आवश्यकता हो और मॉडल अकेले काम कर रहा हो या बहुत कम लोग इसका उपयोग कर रहे हों।
- पेपर का दावा: यह मोड अविश्वसनीय रूप से तेज़ है, लेकिन आमतौर पर, यह "सख्त लेखक" जितना सटीक नहीं होता है। हालाँकि, यह नया मॉडल इतना स्मार्ट है कि तेज़ होने के बावजूद भी सटीकता को उच्च स्तर पर बनाए रखता है।
"ड्राफ्ट और चेक" मोड ("Draft & Check" Mode - Self-Speculation):
- यह कैसे काम करता है: यह पेपर का असली गुप्त मंत्र (secret sauce) है। कल्पना कीजिए कि मॉडल के पास एक "तेज़ दिमाग" और एक "सावधान दिमाग" एक साथ काम कर रहे हैं।
- तेज़ दिमाग (Diffusion): अंदाजे के तौर पर जल्दी से एक पूरा वाक्य ड्राफ्ट करता है।
- सावधान दिमाग (AR): तुरंत उन अंदाजों की जाँच करता है। यदि सावधान दिमाग सहमत है, तो मॉडल उन सभी शब्दों को एक साथ स्वीकार कर लेता है। यदि वह असहमत है, तो वह गलती को ठीक करता है और आगे बढ़ता है।
- पेपर का दावा: व्यक्तिगत उपयोग (जैसे आपके लैपटॉप पर) के लिए यह विजेता है। यह पुराने "एक बार में एक शब्द" वाले तरीके से बहुत तेज़ है और यहाँ तक कि प्रतिस्पर्धियों द्वारा उपयोग किए जाने वाले अन्य "अनुमान लगाने वाले" तरीकों से भी तेज़ है। यह एक ऐसे तेज़ पाठक की तरह है जो अपना काम तुरंत खुद ही एडिट भी कर सकता है।
- यह कैसे काम करता है: यह पेपर का असली गुप्त मंत्र (secret sauce) है। कल्पना कीजिए कि मॉडल के पास एक "तेज़ दिमाग" और एक "सावधान दिमाग" एक साथ काम कर रहे हैं।
यह क्यों महत्वपूर्ण है (अहा! मोमेंट्स)
- वे लड़ते नहीं, वे मदद करते हैं: पेपर में पाया गया कि "सख्त लेखक" और "तेज़ सुधारक" दुश्मन नहीं हैं। वास्तव में, मॉडल को पहले एक सख्त लेखक बनने के लिए सिखाने से बाद में वह एक बेहतर तेज़ सुधारक बन जाता है। यह चलने सीखने से पहले दौड़ना सीखने जैसा है; चलने के प्रशिक्षण से उसे दिशा का बोध (व्याकरण) मिलता है जो उसे बिना दुर्घटना के दौड़ने में मदद करता है।
- प्रतिस्पर्धा से बेहतर: जब उन्होंने इस नए मॉडल का परीक्षण मौजूदा सर्वश्रेष्ठ मॉडलों (जैसे Qwen) के विरुद्ध किया, तो नया मॉडल समान बुद्धिमत्ता बनाए रखते हुए एक सिंगल स्टेप में टोकन (शब्द) उत्पन्न करने में 6 गुना तेज़ था। शक्तिशाली नए कंप्यूटर चिप्स पर, यह वास्तविक दुनिया के कार्यों को संभालने में 4 गुना तेज़ था।
- अभी और भी गति की गुंजाइश है: शोधकर्ताओं ने एक "स्पीड ऑफ लाइट" विश्लेषण किया। उन्होंने पूछा, "यदि हमारे पास एक आदर्श सिस्टम होता तो यह मॉडल वास्तव में कितना तेज़ हो सकता था?" उन्होंने पाया कि वर्तमान "ड्राफ्ट और चेक" विधि पहले से ही बहुत अच्छी है, लेकिन अभी भी सैद्धांतिक अधिकतम गति तक पहुँचने के लिए 76.5% का अंतर बाकी है। इसका मतलब है कि इस तकनीक में भविष्य में बिना किसी नए आविष्कार के और भी तेज़ होने की बहुत गुंजाइश है।
निचोड़ (The Bottom Line)
यह पेपर एक एकल AI मॉडल पेश करता है जो एक धीमा, सटीक लेखक, एक तेज़, समानांतर अनुमान लगाने वाला, या एक हाइब्रिड हो सकता है जो तुरंत ड्राफ्ट और चेक करता है। यह साबित करता है कि आपको गति और सटीकता के बीच चुनाव करने की आवश्यकता नहीं है; आप एक ऐसा मॉडल रख सकते हैं जो दोनों दुनियाओं का सर्वश्रेष्ठ प्राप्त करने के लिए उनके बीच स्विच कर सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।