← नवीनतम पेपर
🤖 machine learning

Multi-Block Diffusion Language Models

यह शोध पत्र मल्टी-ब्लॉक डिफ्यूजन लैंग्वेज मॉडल्स (MBD-LMs) को प्रस्तुत करता है, जो एक नवीन मल्टी-ब्लॉक टीचर फोर्सिंग रणनीति और एक अनुकूलित ब्लॉक बफ़र डिकोडिंग एल्गोरिदम के माध्यम से डिफ्यूजन-आधारित टेक्स्ट जनरेशन में ट्रेनिंग-इन्फरेंस अंतराल को पाटते हुए, जनरेशन की गति (टोकन्स पर फॉरवर्ड पास) और सटीकता दोनों में महत्वपूर्ण लाभ प्राप्त करते हैं।

मूल लेखक: Yijie Jin, Jiajun Xu, Yuxuan Liu, Chenkai Xu, Yi Tu, Jiajun Li, Dandan Tu, Xiaohui Yan, Kai Yu, Pengfei Liu, Zhijie Deng

प्रकाशित 2026-06-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yijie Jin, Jiajun Xu, Yuxuan Liu, Chenkai Xu, Yi Tu, Jiajun Li, Dandan Tu, Xiaohui Yan, Kai Yu, Pengfei Liu, Zhijie Deng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "मल्टी-ब्लॉक डिफ्यूजन लैंग्वेज मॉडल्स" (Multi-Block Diffusion Language Models) के पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी तस्वीर: "असेंबली लाइन" की बाधा को ठीक करना

कल्पना कीजिए कि एक फैक्ट्री कारें (टेक्स्ट) बना रही है।

  • पुराना तरीका (ऑटोरिग्रेसिव - Autoregressive): फैक्ट्री एक बार में एक कार बनाती है। वे पहले इंजन पूरा करते हैं, फिर पहिए, फिर पेंट, और उसके बाद ही वे अगली कार बनाना शुरू करते हैं। यह भरोसेमंद है, लेकिन धीमा है।
  • डिफ्यूजन तरीका (नया कारखाना): शून्य से शुरुआत करने के बजाय, यह फैक्ट्री कबाड़ के ढेर (रैंडम नॉइज़) से शुरू करती है और धीरे-धीरे उसे एक बेहतरीन कार में बदल देती है। इससे वे एक ही समय में कार के कई हिस्सों पर काम कर सकते हैं (पैरेलल प्रोसेसिंग), जो बहुत तेज़ है।

समस्या:
वर्तमान "डिफ्यूजन फैक्ट्री" (जिसे ब्लॉक डिफ्यूजन कहा जाता है) के पास एक चतुर तरकीब है: यह कारों को बैचों (ब्लॉक्स) में बनाती है। हालाँकि, इसमें अभी भी एक बाधा है। यह एक बैच पूरा करती है, उसे स्टोरेज (कैशिंग) में रखती है, और फिर अगला बैच शुरू करती है। यह एक रिले रेस की तरह है जहाँ धावक को अगला धावक दौड़ना शुरू करने से पहले बैटन (बैटन) सौंपने के लिए पूरी तरह रुकना पड़ता है। इससे "वेटिंग बबल्स" (इंतज़ार के बुलबुले) बन जाते हैं जहाँ फैक्ट्री खाली बैठी रहती है।

समाधान: "मल्टी-ब्लॉक" रिले

लेखक एक नई विधि प्रस्तावित करते हैं जिसे मल्टी-ब्लॉक डिफ्यूजन (MBD) कहा जाता है।

उपमा: ओवरलैपिंग रिले (एक साथ चलने वाली रिले)
कल्पना कीजिए कि एक रिले रेस में धावक पिछले धावक के फिनिश लाइन पार करने का इंतज़ार नहीं करते।

  • धावक A अपना चक्कर पूरा कर रहा है।
  • धावक B पहले से ही अगले चक्कर पर दौड़ रहा है।
  • धावक C अगले लेन में तैयार खड़ा है।

वे सभी एक ही समय में दौड़ रहे हैं! यह मल्टी-ब्लॉक डिफ्यूजन है। एक टेक्स्ट ब्लॉक खत्म होने के बाद अगला शुरू करने के बजाय, मॉडल कई ब्लॉक्स को एक साथ रिफाइन करता है। यह एक "पाइपलाइन" बनाता है जहाँ काम लगातार होता रहता है, जिससे प्रक्रिया की गति काफी बढ़ जाती है।

बाधा: ट्रेनिंग बनाम वास्तविकता

इसे करने में एक बड़ी समस्या थी।

  • ट्रेनिंग: मॉडल्स को एक सख्त शिक्षक (टीचर फोर्सिंग - Teacher Forcing) की तरह प्रशिक्षित किया गया था। शिक्षक छात्र को दिखाता था: "यह एक आदर्श पैराग्राफ है, अब इस एक गंदे वाक्य को ठीक करो।" छात्र ने कभी एक साथ कई गंदे वाक्यों को ठीक करने का अभ्यास नहीं किया था।
  • वास्तविकता: जब मॉडल ने "मल्टी-ब्लॉक" रेस (2 या 3 ब्लॉक्स को एक साथ ठीक करना) चलाने की कोशिश की, तो वह लड़खड़ा गया क्योंकि उसने कभी उस विशिष्ट परिदृश्य का अभ्यास नहीं किया था। यह एक ऐसे छात्र से पूछने जैसा था जिसने केवल एक-एक गणित के सवाल हल करने का अभ्यास किया हो, और अचानक उससे तीन वेरिएबल्स वाले जटिल समीकरण को हल करने को कह दिया जाए।

समाधान: "मल्टी-ब्लॉक टीचर फोर्सिंग" (MultiTF)

इसे ठीक करने के लिए, लेखकों ने एक नई ट्रेनिंग विधि बनाई जिसे मल्टी-ब्लॉक टीचर फोर्सिंग (MultiTF) कहा जाता है।

उपमा: सिमुलेशन ड्रिल
केवल एक गंदा वाक्य दिखाने के बजाय, शिक्षक अब उन्हें गंदे वाक्यों की एक पूरी पंक्ति (एक "नॉइज़ ग्रुप") दिखाता है और कहता है, "इन सभी को एक साथ ठीक करो।"

  • वे इसे केवल अनुमानित क्रम में गंदा नहीं करते; वे इसे एक अराजक और वास्तविक तरीके से गंदा करते हैं जो वास्तविक रेस के दौरान होने वाली स्थितियों से मेल खाता है।
  • यह "ड्रिल" मॉडल को बिना भ्रमित हुए एक साथ कई ब्लॉक्स के टेक्स्ट को संभालने के लिए प्रशिक्षित करती है।

इंजन: "ब्लॉक बफ़र" (Block Buffer)

एक प्रशिक्षित मॉडल के साथ भी, इसे कंप्यूटर पर चलाना कठिन है। कंप्यूटर निश्चित आकार (जैसे ठीक 4 स्लॉट वाली ट्रे) के साथ काम करना पसंद करते हैं। यदि आप गतिशील रूप से एक नया ब्लॉक जोड़ने की कोशिश करते हैं, तो कंप्यूटर को रुकना पड़ता है और सब कुछ पुनर्गठित करना पड़ता है, जिससे गति धीमी हो जाती है।

उपमा: फिक्स्ड ट्रे
लेखकों ने एक विशेष "ब्लॉक बफ़र" तंत्र बनाया है।

  • कल्पना कीजिए कि 4 फिक्स्ड स्लॉट वाली एक कन्वेयर बेल्ट है।
  • जब आपको इसकी आवश्यकता हो, तो नया स्लट जोड़ने के बजाय, आप बस एक खाली स्लॉट को एक्टिवेट करते हैं जो पहले से ही वहाँ था।
  • जब एक ब्लॉक खत्म हो जाता है, तो वह बेल्ट से फिसलकर "स्टोरेज लॉकर" (कैश) में चला जाता है, और एक नया खाली स्लट पीछे से अंदर आ जाता है।
  • यह कन्वेयर बेल्ट के आकार को बिल्कुल समान रखता है, जिससे कंप्यूटर बिना रुके अधिकतम गति से चल सकता है।

परिणाम: तेज़ और स्मार्ट

पेपर ने गणित और कोडिंग कार्यों पर इसका परीक्षण किया। यहाँ उन्होंने पाया:

  1. गति: नई विधि (MBD) पुराने तरीके की तुलना में काफी अधिक "टोकन" (शब्द/विचार) प्रति सेकंड प्रोसेस करती है।
    • उपमा: यदि पुरानी फैक्ट्री एक घंटे में 3 कारें बनाती थी, तो नई फैक्ट्री 6 कारें बनाती है।
  2. गुणवत्ता: आमतौर पर, जब आप तेज़ चलने की कोशिश करते हैं, तो आप अधिक गलतियाँ करते हैं। हालाँकि, क्योंकि उन्होंने मॉडल को विशेष रूप से इस "मल्टी-ब्लॉक" शैली (MultiTF का उपयोग करके) के लिए प्रशिक्षित किया था, इसलिए नई फैक्ट्री न केवल तेज़ थी; बल्कि इसने पुराने कारखाने की तुलना में कम गलतियाँ भी कीं।
  3. संगतता (Compatibility): यह नई विधि अन्य स्पीड-बूस्टिंग ट्रिक्स (जैसे DMax) के साथ अच्छी तरह काम करती है, जो पहले से ही उपयोग किए जा रहे थे, जिससे सिस्टम और भी तेज़ हो जाता है।

सारांश

यह पेपर AI टेक्स्ट जनरेटर्स को तेज़ बनाने का एक तरीका पेश करता है, जिससे वे एक ही समय में टेक्स्ट के कई हिस्सों (chunks) पर काम कर सकें। उन्होंने इसे दो तरह से हल किया:

  1. AI को एक साथ कई ब्लॉक्स को संभालने के लिए प्रशिक्षित किया (MultiTF)।
  2. एक ऐसा कंप्यूटर सिस्टम बनाया जो वर्कलोड को स्थिर और कुशल रखता है (Block Buffer)।

परिणामस्वरूप, एक ऐसा टेक्स्ट जनरेटर मिलता है जो पिछले संस्करणों की तुलना में तेज़ और अधिक सटीक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →