← नवीनतम पेपर
💬 NLP

Esoteric Language Models: A Family of Any-Order Diffusion LLMs

यह शोधपत्र Eso-LMs को प्रस्तुत करता है, जो डिफ्यूजन लैंग्वेज मॉडल्स का एक नवीन परिवार है जो अनकंडीशनल जनरेशन के लिए स्पीड-क्वालिटी पारेटो फ्रंटियर पर एक नया स्टेट-ऑफ-द-आर्ट स्थापित करने हेतु KV कैशिंग और पैरेलल जनरेशन को सक्षम करने के लिए कॉज़ल अटेंशन का उपयोग करते हुए ऑटोरेग्रेसिव और मास्क्ड डिफ्यूजन प्रतिमानों को समाहित करता है।

मूल लेखक: Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Esoteric Language Models: A Family of Any-Order Diffusion LLMs" का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: कहानी लिखने के दो तरीके

कल्पना कीजिए कि आप शब्द-दर-शब्द एक वाक्य लिखने की कोशिश कर रहे हैं। वर्तमान में, AI मॉडल आमतौर पर इसे करने के लिए दो में से एक विधि का उपयोग करते हैं:

  1. "सख्त रेखा" विधि (Autoregressive या AR):
    इसे एक व्यक्ति द्वारा पेन से पत्र लिखने जैसा समझें। उन्हें पहले एक शब्द लिखना होगा, फिर दूसरा, फिर तीसरा। वे आगे नहीं बढ़ सकते। यदि वे पहले शब्द को बदलना चाहते हैं, तो उन्हें उसके बाद का सब कुछ मिटाना होगा और फिर से लिखना होगा।
  • फायदे: यह बहुत सटीक और सुसंगत (coherent) है।
  • नुकसान: यह धीमा है। आपको अगला शब्द देखने के लिए हर एक शब्द लिखे जाने तक प्रतीक्षा करनी पड़ती है।
  1. "आंखों पर पट्टी बांधकर स्केच बनाना" विधि (Masked Diffusion या MDM):
    कल्पना कीजिए कि आपको खाली बक्सों (masks) से भरा हुआ एक पेज दिया गया है। AI का काम इन बक्सों को शब्दों से भरना है। लेकिन एक-एक करके भरने के बजाय, यह पूरे पेज को एक साथ देखता है और अनुमान लगाता है कि किसी भी खाली बॉक्स में कौन से शब्द फिट हो सकते हैं, और वह यह सब एक ही समय में करता है। यह कई चरणों (rounds) में काम करता है, धीरे-धीरे अधिक शब्दों को प्रकट करता है जब तक कि वाक्य पूरा न हो जाए।
  • फायदे: यह समानांतर (parallel) में कई शब्दों पर काम कर सकता है (एक ही समय में), जिससे यह होना चाहिए तेज़।
  • नुकसान: व्यवहार में, यह "सख्त रेखा" विधि की तुलना में वास्तव में धीमा है क्योंकि जब भी कोई नया शब्द प्रकट होता है, तो कंप्यूटर को पूरा पेज फिर से कैलकुलेट करना पड़ता है। इसके पास "मेमोरी शॉर्टकट" (जिसे KV Caching कहा जाता है) भी नहीं है जो "सख्त रेखा" विधि को तेज़ चलाने में मदद करता है।

समस्या

"आंखों पर पट्टी बांधकर स्केच बनाना" विधि (MDM) आशाजनक है क्योंकि यह अधिक नियंत्रण और समानांतर प्रसंस्करण (parallel processing) की अनुमति देती है, लेकिन इसमें दो बड़ी खामियां हैं:

  1. यह सुस्त है: क्योंकि इसमें "मेमोरी शॉर्टकट" की कमी है, यह उस काम को दोबारा करने में कंप्यूटिंग शक्ति बर्बाद करता है जो इसने पहले ही कर लिया था।
  2. यह कम सटीक है: यह "सख्त रेखा" विधि की तरह भाषा के प्रवाह को उतनी अच्छी तरह नहीं समझ पाता।

इसे ठीक करने के हालिया प्रयासों (जैसे BD3-LMs नामक विधि) ने वाक्यों को छोटे ब्लॉक्स में तोड़ने और उन्हें एक-एक करके भरने की कोशिश की। लेकिन इससे नई समस्याएं पैदा हुईं: यदि प्रक्रिया में जल्दबाजी की गई, तो वाक्य निरर्थक या दोहराव वाले हो गए।

समाधान: "एज़ोटेरिक लैंग्वेज मॉडल्स" (Eso-LMs)

लेखकों ने एक नया हाइब्रिड मॉडल बनाया है जिसे Eso-LMs कहा जाता है। इसे एक "स्मार्ट हाइब्रिड कार" के रूप में समझें जो सड़क की स्थिति के आधार पर दो इंजनों के बीच स्विच कर सकती है।

1. हाइब्रिड दृष्टिकोण (The Hybrid Approach)

Eso-LMs दोनों दुनियाओं की सर्वश्रेष्ठ चीजों को जोड़ता है:

  • चरण 1 (स्केच): यह "आंखों पर पट्टी बांधकर स्केच बनाने" की विधि की तरह शुरू होता है, पूरे वाक्य में समानांतर रूप से कुछ शब्दों को भरता है।
  • चरण 2 (रेखा): एक बार जब कुछ शब्द भर दिए जाते हैं, तो यह शेष रिक्त स्थानों को बाएं से दाएं भरने के लिए "सख्त रेखा" विधि पर स्विच हो जाता है।

एक डायल (जिसे α0\alpha_0 कहा जाता है) को समायोजित करके, आप यह तय कर सकते हैं कि कितने हिस्से का काम समानांतर में किया जाना है और कितने हिस्से का काम क्रमिक (sequentially) रूप से किया जाना है। यह मॉडल को एक शुद्ध "स्केच" मॉडल और एक शुद्ध "रेखा" मॉडल के बीच सहजता से फिसलने की अनुमति देता है।

2. "मेमोरी शॉर्टकट" (KV Caching)

सबसे बड़ी सफलता यह है कि Eso-LMs अंततः "आंखों पर पट्टी बांधकर स्केच बनाने" वाली विधि को मेमोरी शॉर्टकट (KV Caching) का उपयोग करने की अनुमति देता है।

  • उपमा: कल्पना कीजिए कि आप एक भित्ति चित्र (mural) पेंट कर रहे हैं। पुरानी विधि में, हर बार जब आप एक नया ब्रश स्ट्रोक लगाते थे, तो आपको पूरा बैकग्राउंड फिर से पेंट करना पड़ता था ताकि रंग मेल खा सकें। Eso-Lms में, एक बार जब आप एक हिस्सा पेंट कर लेते हैं, तो आप उसे अपनी मेमोरी में "लॉक" कर देते हैं। जब आप अगले हिस्से को पेंट करते हैं, तो आप केवल लॉक किए गए हिस्सों और उस नए क्षेत्र को देखते हैं जिस पर आप काम कर रहे हैं। आप पूरी दीवार को फिर से पेंट नहीं करते हैं।
  • परिणाम: यह मॉडल को काफी तेज़ बनाता है, विशेष रूप से लंबे टेक्स्ट के लिए।

3. "Any-Order" अटेंशन (Any-Order Attention)

इसे काम करने के लिए, लेखकों ने AI के शब्दों को "देखने" के तरीके को बदल दिया।

  • मानक "स्केच" मॉडल सभी शब्दों को समान रूप से देखते हैं (bidirectional)।
  • मानक "लाइन" मॉडल केवल पिछले शब्दों को देखते हैं (causal)।
  • Eso-LMs एक चालाकी भरा तरीका अपनाता है: यह शब्दों को इस तरह से शफल (shuffle) करता है कि "भरे हुए" शब्द पहले आते हैं, और "खाली" शब्द बाद में। फिर यह इस शफल की गई सूची पर "लाइन" विधि के तर्क का उपयोग करता है। यह इसे मेमोरी शॉर्टकट का उपयोग करने की अनुमति देता है जबकि यह अभी भी यादृच्छिक (random) और समानांतर क्रम में शब्दों को भर सकता है।

यह क्यों महत्वपूर्ण है?

  1. गति बनाम गुणवत्ता का संतुलन: शोध पत्र दिखाता है कि Eso-LMs "पारेटो फ्रंटियर" (Pareto Frontier) पर स्थित है। यह एक फैंसी तरीका है यह कहने का कि यह गति और गुणवत्ता के बीच सबसे अच्छा संभव तालमेल प्रदान करता है। यह पुराने "स्केच" मॉडलों की तुलना में तेज़ है और "ब्लॉक" विधियों की तुलना में उच्च-गुणवत्ता वाला टेक्स्ट बनाता है।
  2. कोई "डिजेनरेट" सैंपल नहीं: पिछले हाइब्रिड तरीकों के विपरीत, जो जल्दबाजी करने पर बकवास (gibberish) पैदा करते थे, Eso-LMs तब भी अच्छी गुणवत्ता बनाए रखता है जब आप इसे बहुत तेज़ी से (कम स्टेप्स का उपयोग करके) टेक्स्ट जेनरेट करने के लिए कहते हैं।
  3. सटीक संभावना (Exact Likelihood): पहली बार, लेखक इन डिफ्यूजन मॉडल्स द्वारा जेनरेट किए गए टेक्स्ट की सटीक "संभावना" (likelihood) की गणना करने का एक तरीका प्रदान करते हैं। यह AI को सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करके बेहतर सोचने के लिए प्रशिक्षित करने में महत्वपूर्ण है।

सारांश में

Eso-LMs एक नए प्रकार का AI लैंग्वेज मॉडल है जो एक हाइब्रिड वाहन की तरह काम करता है। यह शब्दों को समानांतर में भरने (एक स्केच की तरह) से शुरू होता है और बाकी को क्रम में भरने (एक रेखा की तरह) के साथ समाप्त होता है। एक चालाकी भरे शफलिंग ट्रिक का उपयोग करके, यह एक "मेमोरी शॉर्टकट" को अनलॉक करता है जो इसे पिछले समानांतर मॉडलों की तुलना में बहुत तेज़ बनाता है, बिना टेक्स्ट की गुणवत्ता से समझौता किए। यह वर्तमान के अत्याधुनिक तरीकों की तुलना में तेज़, अधिक लचीला और अधिक कुशल है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →