← नवीनतम पेपर
💬 NLP

Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?

यह शोध पत्र तर्क देता है कि डिफ्यूजन लैंग्वेज मॉडल्स में ऑटोरेग्रेसिव-जैसे डिकोडिंग की व्यापकता उनके उद्देश्यों और क्रमिक प्रशिक्षण डेटा के बीच एक बेमेल (mismatch) से उत्पन्न होती है, और NAP का प्रस्ताव करता है, जो एक डेटा-केंद्रित दृष्टिकोण है जो गणितीय तर्क बेंचमार्क पर बेहतर प्रदर्शन के साथ वास्तविक समानांतर, गैर-ऑटोरेग्रेसिव पीढ़ी को सक्षम करने के लिए स्वतंत्र तर्क प्रक्षेपवक्रों (reasoning trajectories) को क्यूरेट करता है।

मूल लेखक: Pengxiang Li, Dilxat Muhtar, Tianlong Chen, Lu Yin, Shiwei Liu

प्रकाशित 2026-03-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pengxiang Li, Dilxat Muhtar, Tianlong Chen, Lu Yin, Shiwei Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके पेपर की व्याख्या दी गई है।

बड़ी समस्या: वह "तेज़" ट्रेन जो केवल एक ही पटरी पर चलती है

कल्प-ना कीजिए कि आपके पास एक विशाल, अत्यंत बुद्धिमान रोबोट है (एक डिफ्यूजन लैंग्वेज मॉडल - Diffusion Language Model) जिसे कहानियाँ लिखने या गणित की समस्याओं को हल करने के लिए बनाया गया है। इस रोबोट की सबसे बड़ी खासियत यह है कि यह सब कुछ एक साथ लिख सकता है, जैसे एक समूह गान (choir) एक ही समय में पूरा गाना गाता है, न कि एक-एक स्वर करके। इसे पैरेलल डिकोडिंग (Parallel Decoding) कहा जाता है।

सिद्धांत रूप में, यह अविश्वसनीय रूप से तेज़ होना चाहिए। यदि आपके पास 100 कर्मचारी हैं, तो उन्हें एक कर्मचारी की तुलना में 100 गुना तेज़ी से काम पूरा करना चाहिए।

लेकिन यहाँ एक पेंच है: भले ही रोबोट एक साथ सब कुछ लिख सकता है, लेकिन व्यवहार में, यह एक धीमे, एक कतार वाले कर्मचारियों की तरह काम करता रहता है। यह शब्द #1 लिखता है, फिर शब्द #2, फिर शब्द #3। यह "ऑटोरिग्रेसिव" (Autoregressive - AR) मोड में फँसा हुआ है। यह एक ऐसी ट्रेडमिल पर मैराथन दौड़ने की कोशिश कर रहा है जो केवल एक बार में एक कदम ही आगे बढ़ती है।

पेपर पूछता है: ऐसा क्यों हो रहा है? और इसे कैसे ठीक किया जाए?


निदान (Diagnosis): रोबोट ने गलत आदत सीख ली

लेखकों ने पाया कि रोबोट टूटा हुआ नहीं है; यह बस गलत तरीके से प्रशिक्षित (badly trained) है।

प्रशिक्षण डेटा (वे किताबें और गणित की समस्याएँ जिन्हें रोबलेट पढ़ता है) को एक रेसिपी बुक (व्यंजन पुस्तिका) के रूप में सोचें।

  • मानक रेसिपी बुक्स: दुनिया की लगभग सभी रेसिपी एक सख्त, चरण-दर-चरण क्रम में लिखी जाती हैं। "पहले, प्याज काटें। फिर, लहसुन डालें। फिर, पैन गरम करें।"
  • रोबोट का तर्क: क्योंकि रोबोट ने लाखों ऐसी चरण-दर-चरण रेसिपी पढ़ी हैं, उसने सीख लिया है कि सोचना एक श्रृंखला (chain) है। उसका मानना है कि किसी समस्या को हल करने के लिए, आपको चरण A को पूरा करने के बाद ही चरण B के बारे में सोचना चाहिए।

भले ही रोबोट के पास एक साथ सब कुछ करने के लिए हार्डवेयर है, लेकिन उसका दिमाग (जो क्रमिक डेटा पर प्रशिक्षित है) उसे एक-एक करके करने के लिए मजबूर करता है। यह एक फॉर्मूला 1 कार देने जैसा है जिसे चलाने वाला ड्राइवर केवल कच्ची सड़क पर सीधी रेखा में गाड़ी चलाना जानता है; कार तेज़ है, लेकिन ड्राइवर उसकी गति का उपयोग ही नहीं होने देता।

पेपर दिखाता है कि जब आप रोबोट को समानांतर (parallel) रूप से लिखने के लिए मजबूर करते हैं (उसकी गति परीक्षण करने के लिए), तो वह भ्रमित हो जाता है और बहुत बड़ी गलतियाँ करता है। उसे काम करने के लिए "चरण-दर-चरण" वाले सहारे की आवश्यकता होती है।


समाधान: NAP (नॉन-ऑटोरिग्रेसिव पैरेलल DLMs)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे NAP कहा जाता है। परीक्षण के दौरान रोबोट को अपनी सोच बदलने के लिए मजबूर करने के बजाय, उन्होंने रेसिपी बुक को ही दोबारा लिख दिया ताकि उसे समानांतर (parallel) रूप से सोचना सिखाया जा सके।

NAP कैसे काम करता है, इसे एक निर्माण स्थल (Construction Site) की उपमा से समझते हैं:

1. पुराना तरीका (मानक प्रशिक्षण)

कल्पना कीजिए कि एक निर्माण दल घर बना रहा है।

  • नियम: आप छत तब तक नहीं बना सकते जब तक दीवारें खड़ी न हों। आप दीवारें तब तक नहीं बना सकते जब तक नींव न डाली गई हो।
  • परिणाम: दल एक सख्त कतार में काम करता है। भले ही आपके पास 50 कर्मचारी हों, वे सभी अपने आगे वाले व्यक्ति के खत्म करने का इंतज़ार करते हैं। यह धीमा है।

2. NAP का तरीका (नया प्रशिक्षण)

लेखकों ने प्रशिक्षण डेटा को बदलकर स्वतंत्र वास्तुकारों (Architects) की एक टीम जैसा बना दिया।

  • व्यवस्था: एक लंबे निर्देश की श्रृंखला के बजाय, वे रोबोट को एक ही घर पर एक साथ काम करने वाली तीन अलग-अलग टीमें देते हैं।
    • टीम A रसोई का डिज़ाइन बनाने की कोशिश करती है।
    • टीम B एक अलग शैली का उपयोग करके रसोई का डिज़ाइन बनाने की कोशिश करती है।
    • टीम C रसोई का डिज़ाइन बनाने की कोशिश करती है लेकिन गलती करती है।
  • लक्ष्य: रोबोट को इन सभी टीमों को एक साथ काम करते हुए देखना होता है, यह समझना होता है कि कौन से विचार अच्छे हैं, गलतियों को नज़रअंदाज़ करना होता है, और फिर सर्वोत्तम रसोई डिज़ाइन का अंतिम सारांश लिखना होता है।

इन कई स्वतंत्र रास्तों पर रोबोट को प्रशिक्षित करके, वह सीखता है कि:

  1. आपको "दाहिने" हिस्से को शुरू करने से पहले "बाएं" हिस्से के खत्म होने का इंतज़ार करने की ज़रूरत नहीं है।
  2. आप एक साथ कई संभावनाओं को तलाश सकते हैं।
  3. अंतिम उत्तर इन समानांतर विचारों को जोड़ने से आता है, न कि केवल एक एकल रेखा का पालन करने से।

परिणाम: बाधा को तोड़ना

जब उन्होंने इस नए "NAP" रोबोट का परीक्षण किया:

  • पुराना रोबोट: जब उसे तेज़ी से काम करने (पैरेलल मोड) के लिए मजबूर किया गया, तो वह ढह गया। उसने एक साथ सब कुछ करने की कोशिश की लेकिन सोचना भूल गया, जिससे केवल अर्थहीन शब्द (gibberish) निकले।
  • NAP रोबोट: वह फला-फूला। क्योंकि उसे एक साथ कई विचारों को संभालने के लिए प्रशिक्षित किया गया था, वह गुणवत्ता खोए बिना समानांतर में टेक्स्ट उत्पन्न करने में सक्षम था।

"गति" का लाभ:
उन्होंने रोबोट को जितना अधिक समानांतर रूप से काम करने के लिए मजबूर किया (एक साथ अधिक शब्द उत्पन्न करना), NAP रोबोट ने पुराने वाले की तुलना में उतना ही बेहतर प्रदर्शन किया। पुराने रोबोट को तेज़ करने की कोशिश करने पर वह धीमा और कम बुद्धिमान होता गया। NAP रोबोट तेज़ होता गया और समझदार भी बना रहा।

मुख्य निष्कर्ष (Takeaway)

पेपर यह निष्कर्ष निकालता है कि AI को तेज़ बनाने के लिए आप केवल सॉफ्टवेयर (डिकोडिंग नियम) को नहीं बदल सकते। आपको डेटा (प्रशिक्षण सामग्री) को बदलना होगा।

यदि आप चाहते हैं कि एक AI एक सुपर-फास्ट पैरलल प्रोसेसर की तरह सोचे, तो आप उसे चरण-दर-चरण मैनुअल के साथ नहीं सिखा सकते। आपको उसे बहु-धागे (multi-threaded), अराजक, समानांतर मंथन सत्रों (brainstorming sessions) के साथ सिखाना होगा।

संक्षेप में: एक वास्तविक समानांतर AI प्राप्त करने के लिए, उसे एक कतार में चलना सिखाना बंद करें। उसे एक पूरे समूह के साथ घेरे में नृत्य करना सिखाएं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →