← नवीनतम पेपर
💬 NLP

Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed

यह शोधपत्र Efficient-DLM प्रस्तुत करता है, जो एक ऐसा ढांचा है जो ब्लॉक-वाइज अटेंशन पैटर्न और पोजीशन-डिपेंडेंट टोकन मास्किंगिंग का उपयोग करके प्रीट्रेन ऑटोरेग्रेसिव मॉडल्स को अत्यधिक कुशल डिफ्यूजन लैंग्वेज मॉडल्स में परिवर्तित करता है, जिससे अत्याधुनिक मॉडल्स की तुलना में बेहतर सटीकता और थ्रूपुट प्राप्त होता है।

मूल लेखक: Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

प्रकाशित 2026-05-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी तस्वीर: ट्रैफिक जाम बनाम हाईवे

एक कहानी लिखने के दो तरीके की कल्पना करें:

  1. पुराना तरीका (Autoregressive/AR): यह एक एकल-लेन वाली सड़क (single-lane road) की तरह है। आप एक शब्द लिखते हैं, फिर अगला, फिर अगला। जब तक पहला शब्द पूरा नहीं हो जाता, आप दूसरा नहीं लिख सकते। यह बहुत सटीक है, लेकिन धीमा है क्योंकि आपको हर एक शब्द के लिए लाइन में इंतज़ार करना पड़ता है।
  2. नया तरीका (Diffusion/DLM): यह एक मल्टी-लेन हाईवे (multi-lane highway) की तरह है। आप एक साथ कई शब्द लिख सकते हैं (समानांतर में/parallel)। यह बहुत तेज़ होना चाहिए। हालाँकि, अतीत में, ये "हाईवे" ऊबड़-खाबड़, भ्रमित करने वाले थे और अक्सर एकल-लेन वाली सड़क की तुलना में कम गुणवत्ता वाली कहानियाँ बनाते थे। इन्हें बनाना (ट्रेन करना) भी बहुत महंगा था।

समस्या: वैज्ञानिक हाईवे की गति और एकल-लेन वाली सड़क की गुणवत्ता चाहते थे, लेकिन वे इसे बिना शून्य से शुरू किए (जिसमें बहुत पैसा खर्च होता है) नहीं बना पा रहे थे।

समाधान: इस पेपर के लेखकों ने यह पता लगाया कि कैसे एक मौजूदा, उच्च-गुणवत्ता वाले "एकल-लेन" मॉडल को एक "हाईवे" मॉडल में बदला जा सकता है जो तेज़ भी हो और सटीक भी। वे इस नए मॉडल परिवार को Efficient-DLM कहते हैं।


उन्होंने यह कैसे किया: तीन मुख्य तरकीबें

पेपर में तीन मुख्य "नियमों" की पहचान की गई है जिनका पालन उन्हें इस परिवर्तन को सफल बनाने के लिए करना था।

1. "साफ संदर्भ" का नियम (The "Clean Context" Rule - Block-Way)

  • पुरानी गलती: पिछले प्रयासों में मॉडल को पूरे वाक्य को एक साथ देखने की अनुमति दी गई थी, यहाँ तक कि उन हिस्सों को भी जो अभी भी अस्त-व्यमस्त या गायब थे। कल्पना करें कि आप एक पहेली (puzzle) हल करने की कोशिश कर रहे हैं जहाँ आधे टुकड़े गायब हैं, और आपको खाली स्थानों को भरा हुआ मानकर देखने की अनुमति है। इसने मॉडल को भ्रमित किया और उसे वह सब भुला दिया जो उसने पहले सीखा था।
  • सुधार: लेखकों ने वाक्य को छोटे ब्लॉक्स (blocks) (जैसे किताब के अध्याय) में तोड़ने का निर्णय लिया।
    • मॉडल पिछले अध्यायों को देखता है, जो पहले से ही पूरे और साफ हैं।
    • यह केवल वर्तमान अध्याय को ठीक करने की कोशिश करता है, जो अस्त-व्यमस्त है।
    • उदाहरण: इसे एक निर्माण दल (construction crew) की तरह समझें। वे एक ही बार में पूरी इमारत को ठीक करने की कोशिश नहीं करते। वे दूसरी मंजिल को ठीक करने से पहले नींव और पहली मंजिल (साफ संदर्भ) को पूरा करते हैं। यह संरचना को स्थिर रखता है और उन्हें एक "शॉर्टकट" (जिसे KV caching कहा जाता है) का उपयोग करने की अनुमति देता है ताकि वे जो पहले बना चुके हैं उसे याद रख सकें, जिससे प्रक्रिया बहुत तेज़ हो जाती है।

2. "नो टोकन शिफ्ट" का नियम (The "No Token Shift" Rule - अगला कदम अनुमान लगाना बंद करें)

  • पुरानी गलती: पुराने मॉडल को बदलते समय, शोधकर्ता मॉडल को अगले शब्द का अनुमान लगाने के लिए मजबूर करते थे, ठीक वैसे ही जैसे पुराना एकल-लेन मॉडल करता था।
  • सुधार: लेखकों ने पाया कि मॉडल को "अगले" शब्द का अनुमान लगाने की आवश्यकता नहीं है। उसे बस अपने सामने मौजूद गायब शब्दों को ठीक करने की आवश्यकता है।
  • उदाहरण: कल्पना करें कि आप एक दस्तावेज़ को एडिट कर रहे हैं।
    • पुराना तरीका: आप एक वाक्य पढ़ते हैं, फिर वर्तमान को एडिट करने से पहले ही अगले वाक्य की भविष्यवाणी करने की कोशिश करते हैं।
    • नया तरीका: आप बस वर्तमान पैराग्राफ के खाली स्थानों को भरने पर ध्यान केंद्रित करते हैं। यह पता चला कि भविष्य की भविष्यवाणी करने की तुलना में खाली स्थानों को भरना आसान और अधिक सटीक है।

3. "पोजीशन-डिपेंडेंट मास्किंग" का नियम (The "Position-Dependent Masking" Rule - बाएँ-से-दाएँ झुकाव)

  • समस्या: जब मॉडल को प्रशिक्षित (train) किया जा रहा होता है, तो यह शब्दों को रैंडम तरीके से छिपा देता है (जैसे लॉटरी नंबर चुनना)। लेकिन जब मॉडल वास्तव में इस्तेमाल (inference) किया जाता है, तो यह स्वाभाविक रूप से शब्दों को बाएँ से दाएँ पूरा करता है, ठीक वैसे ही जैसे इंसान पढ़ते हैं। इससे एक बेमेल स्थिति पैदा हुई: प्रशिक्षण वास्तविक परीक्षण जैसा नहीं था।
  • सुधार: लेखकों ने प्रशिक्षण को इस तरह बदला कि मॉडल एक ब्लॉक के अंत में शब्दों को छिपाने की अधिक संभावना रखता है, न कि शुरुआत में।
  • उदाहरण: कल्पना करें कि एक शिक्षक टेस्ट चेक कर रहा है।
    • पुराना प्रशिक्षण: शिक्षक पेज पर रैंडम सवाल ढक देता है।
    • नया प्रशिक्षण: शिक्षक को एहसास होता है कि छात्र आमतौर पर सेक्शन के आखिरी कुछ सवालों पर अटक जाते हैं। इसलिए, शिक्षक विशेष रूप से सेक्शन के अंत को ढकने का अभ्यास करता है। यह मॉडल को वास्तविक दुनिया के लिए तैयार करता है, जहाँ उसे बाएँ से दाएँ वाक्य को पूरा करना होता है।

परिणाम: गति और बुद्धिमत्ता

इन नियमों का पालन करके, लेखकों ने Efficient-DLM परिवार (1.5B, 4B, और 8B आकार) बनाया।

  • गति: वे मौजूदा सर्वश्रेष्ठ मॉडलों की तुलना में काफी तेज़ हैं। उदाहरण के लिए, उनका 8B मॉडल "Dream" नामक प्रतिद्वंद्वी से 4.5 गुना तेज़ है और "Qwen3 4B" से 2.7 गुना तेज़ है।
  • सटीकता: तेज़ होने के बावजूद, वे वास्तव में गणित, कोडिंग और तर्क (reasoning) के कार्यों में उन मॉडलों से अधिक सटीक हैं जिन्हें वे पीछे छोड़ रहे हैं।
  • लचीलापन: चूंकि वे एक साथ कई शब्द उत्पन्न कर सकते हैं, इसलिए आप उन्हें ट्यून कर सकते हैं। यदि आपको गति चाहिए, तो आप एक साथ कई शब्द उत्पन्न करते हैं। यदि आपको अत्यधिक सटीकता चाहिए, तो आप एक बार में कम शब्द उत्पन्न करते हैं। यह एक ऐसी कार की तरह है जो तुरंत "रेसिंग मोड" और "क्रूजिंग मोड" के बीच स्विच कर सकती है।

सारांश

पेपर कहता है: "हमने एक धीमे, सटीक मॉडल को हाईवे पर दौड़ना सिखाया। हमने इसे साफ ब्लॉक्स में काम को व्यवस्थित करके, भविष्य का अनुमान लगाना बंद करके और वाक्यों के अंत पर ध्यान केंद्रित करने के लिए प्रशिक्षित करके किया। परिणाम एक ऐसा मॉडल परिवार है जो वर्तमान के स्टेट-ऑफ-द-आर्ट मॉडलों से तेज़ और स्मार्ट दोनों है।"

उन्होंने यह भी नोट किया कि क्योंकि ये मॉडल दोनों दिशाओं (bidirectional) से टेक्स्ट को देख सकते हैं, इसलिए वे सर्च और एम्बेडिंग कार्यों के लिए टेक्स्ट के "अर्थ" को समझने में आश्चर्यजनक रूप से अच्छे हैं, जो पुराने एक-दिशा वाले मॉडलों से बेहतर प्रदर्शन करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →