← नवीनतम पेपर
💬 NLP

Nemotron-TwoTower: Diffusion Language Modeling with Pretrained Autoregressive Context

नेट्रोन-टूटावर (Netron-TwoTower) एक नवीन ब्लॉक-वाइज ऑटोरेग्रेसिव डिफ्यूजन आर्किटेक्चर पेश करता है जो संदर्भ प्रसंस्करण (context processing) और डिनोइजिंग को दो विशिष्ट टावरों में अलग करता है, जिससे अपने ऑटोरेग्रेसिव बेसलाइन की 98.7% गुणवत्ता बनाए रखते हुए 2.42 गुना तेज़ जनरेशन थ्रूपुट प्राप्त होता है।

मूल लेखक: Fitsum Reda, John Kamalu, Roger Waleffe, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

प्रकाशित 2026-06-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fitsum Reda, John Kamalu, Roger Waleffe, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपका एक सख्त नियम है: आप एक बार में केवल एक शब्द लिख सकते हैं, और आपको अगला शब्द शुरू करने से पहले पिछले शब्द को पूरी तरह से समाप्त होने का इंतज़ार करना होगा। यह अधिकांश वर्तमान AI भाषा मॉडल (जिसे "ऑटोरिग्रेसिव" मॉडल कहा जाता है) के काम करने का तरीका है। यह एक बहुत ही सावधान, धीमी टाइप करने वाली मशीन की तरह है जो कभी गलती नहीं करती लेकिन वाक्य पूरा करने में बहुत समय लेती है।

अब, एक नई विधि की कल्पना करें जहाँ आप एक साथ पूरा वाक्य टाइप कर सकते हैं, उसे देख सकते हैं, और फिर एक साथ सभी शब्दों की गलतियों को सुधार सकते हैं। यह तेज़ है, लेकिन आमतौर पर इससे कहानी की गुणवत्ता कम हो जाती है क्योंकि AI एक साथ सब कुछ ठीक करने की कोशिश में भ्रमित हो जाता है।

Nemotron-TwoTower एक नया आविष्कार है जो दोनों दुनियाओं का सर्वश्रेष्ठ प्राप्त करने की कोशिश करता है: एक साथ सब कुछ टाइप करने की गति, और एक-एक करके शब्द लिखने वाले सावधान टाइपिस्ट की उच्च गुणवत्ता।

यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:

दो टावर: लाइब्रेरियन और एडिटर

शोधकर्ताओं ने एक प्रणाली बनाई है जिसमें दो अलग-अलग "टावर" (AI के भाग) हैं जो एक टीम की तरह मिलकर काम करते हैं:

  1. द फ्रोजन कॉन्टेक्स्ट टावर (लाइब्रेरियन):

    • भूमिका: यह वह "विशेषज्ञ" है जो अब तक की कहानी जानता है। यह एक पूर्व-प्रशिक्षित AI है जो फ्रीज़ (लॉक) है। यह एक सख्त लाइब्रेरियन की तरह है जो कहानी को शुरुआत से अंत तक शब्द-दर-शब्द पढ़ता है।
    • काम: यह बदलता नहीं है। यह बस अब तक लिखी गई हर चीज़ का एक सटीक, व्यवस्थित रिकॉर्ड रखता है। यह दूसरे टावर को बताता है, "यहाँ इस बिंदु तक कहानी का संदर्भ (context) है।"
    • यह क्यों महत्वपूर्ण है: क्योंकि यह फ्रीज़ है, यह अपने मूल 30-बिलियन-पैरामीटर मॉडल की सारी मूल बुद्धिमत्ता और ज्ञान को बनाए रखता है। यह कभी नहीं भूलता और न ही भ्रमित होता है।
  2. द ट्रेन करने योग्य डिफ्यूजन डिनोइज़र टावर (एडिटर):

    • भूमिका: यह एक "तेज़ कार्यकर्ता" है। यह एक ट्रेन करने योग्य AI है जिसे बदलने और सीखने की अनुमति है।
    • काम: एक-एक शब्द लिखने के बजाय, यह 16 शब्दों (या टोकन) का एक ब्लॉक लेता है जो वर्तमान में खाली (मास्क किए हुए) हैं। यह "लाइब्रेरियन" के नोट्स को देखता है और एक साथ सभी 16 खाली स्थानों को भरने की कोशिश करता है।
    • प्रक्रिया: यह तुरंत सटीक नहीं होता है। यह एक अनुमान लगाता है, फिर अपने अनुमान और लाइब्रेरियन के नोट्स को देखता है, और शब्दों को परिष्कृत (refine) करता है। यह बार-बार (पुनरावृत्ति के माध्यम से) तब तक करता है जब तक कि शब्दों का ब्लॉक साफ और अर्थपूर्ण न हो जाए।
    • जादू: क्योंकि यह सभी 16 शब्दों को एक साथ देख सकता है और उन्हें एक साथ ठीक कर सकता है, यह एक-एक करके लिखने की तुलना में बहुत तेज़ है।

वे एक साथ कैसे काम करते हैं (असेंबली लाइन)

एक फैक्ट्री असेंबली लाइन की कल्पना करें:

  1. लाइब्रेरियन प्रॉम्प्ट और पहले से लिखे गए शब्दों को पढ़ता है, जिससे कहानी का एक सटीक मानसिक मानचित्र बना रहता है।
  2. एडिटर कागज का एक खाली हिस्सा (16 शब्द लंबा) लेता है।
  3. एडिटर लाइब्रेरियन से पूछता है, "आगे क्या आता है?" और लाइब्रेरियन संदर्भ प्रदान करता है।
  4. एडिटर 16 खाली स्थानों को भरता है, अपने काम की जाँच करता है, और त्रुटियों को ठीक करता है।
  5. एक बार जब एडिटर आश्वस्त हो जाता है कि 16 शब्द सही हैं, तो वे "कमिट" (अंतिम रूप से तय) कर दिए जाते हैं।
  6. लाइब्रेरियन इन नए 16 शब्दों को शामिल करने के लिए अपने मानसिक मानचित्र को अपडेट करता है।
  7. एडिटर अगले 16 शब्दों के खाली हिस्से को पकड़ता है, और चक्र दोहराया जाता है।

परिणाम: गति बनाम गुणवत्ता

पेपर का दावा है कि यह प्रणाली एक "स्वीट स्पॉट" प्राप्त करती है:

  • गति: यह पारंपरिक एक-एक शब्द लिखने वाले तरीके की तुलना में 2.42 गुना तेज़ है। यह एक घोंघे से स्प्रिंटर (धावक) में बदलने जैसा है।
  • गुणवत्ता: यह मूल मॉडल की गुणवत्ता का 98.7% बनाए रखता है। इसने गति पाने के लिए अपनी बुद्धिमत्ता को बहुत कम नहीं किया है।
  • दक्षता: उन्होंने इस नए "एडिटर" टावर को लगभग 2.1 ट्रिलियन शब्दों पर प्रशिक्षित किया, जो मूल "लाइब्रेरियन" को प्रशिक्षित करने के लिए उपयोग किए गए 25 ट्रिलियन शब्दों का एक बहुत छोटा हिस्सा है। इसका मतलब है कि उन्हें पूरे AI को फिर से शून्य से सिखाने की आवश्यकता नहीं थी; उन्होंने बस एडिटर को लाइब्रेरियन के नोट्स का उपयोग करना सिखाया।

यह पिछले प्रयासों से अलग क्यों है

पिछले प्रयासों ने एक ही मस्तिष्क का उपयोग करने की कोशिश की: कहानी को याद रखना और शब्दों को एक साथ ठीक करना। पेपर का तर्क है कि यह एक व्यक्ति से एक साथ एक आदर्श स्मृति रखने वाला और एक तेज़ संपादक होने के लिए कहने जैसा है—यह बहुत अधिक काम है, और वे दोनों में से कोई भी काम पूरी तरह से नहीं कर पाते हैं।

दो टावरों में भूमिकाओं को विभाजित करके, उन्होंने प्रत्येक भाग को वह करने दिया जिसमें वह सबसे अच्छा है। लाइब्रेरियन सटीक रहता है, और एडिटर तेज़ हो जाता है।

"कॉन्फिडेंस" ट्रिक

इस प्रणाली में एक स्मार्ट फीचर भी है जिसे "कॉन्फिडेंस अनमास्किंग" कहा जाता है।

  • यदि एडिटर किसी शब्द के बारे में बहुत आश्वस्त है, तो वह उसे तुरंत लॉक कर देता है।
  • यदि वह अनिश्चित है, तो वह उस शब्द को खाली (मास्क) छोड़ देता है और संपादन के अगले दौर में उसे ठीक करने की कोशिश करता है।
  • इसका मतलब है कि यह उन शब्दों को दोबारा चेक करने में समय बर्बाद नहीं करता जिन्हें वह पहले से ही सही जानता है, बल्कि यह कठिन हिस्सों को पॉलिश करने के लिए अतिरिक्त समय खर्च करता है।

सारांश

Nemotron-TwoTower एक तरीका है जिससे AI टेक्स्ट जनरेशन को बिना "मूर्ख" बनाए बहुत तेज़ बनाया जा सकता है। यह "कहानी याद रखने" (जो धीमा और सटीक रहता है) और "अगले हिस्से को लिखने" (जो तेज़ और पुनरावृत्ति वाला बन जाता है) के काम को अलग करके ऐसा करता है। परिणाम यह है कि यह सिस्टम पुराने धीमे तरीके की तरह लगभग उतनी ही अच्छी तरह से कहानियाँ लिखता है, लेकिन दोगुने से भी अधिक तेज़ी से।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →