← नवीनतम पेपर
🤖 AI

Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation

यह शोध पत्र बाइफोकल डिफ्यूजन लैंग्वेज मॉडल्स, विशेष रूप से R2LM आर्किटेक्चर को प्रस्तुत करता है, जो बाइडायरेक्शनल कॉन्टेक्स्ट (bidirectional context) को संरक्षित करते हुए KV कैशिंग के साथ पैरेलल डिकोडिंग को सक्षम करने के लिए कॉज़ल अटेंशन (causal attention) को एक हल्के रिवर्स माम्बा साइडकार (reverse Mamba sidecar) के साथ जोड़कर डिस्क्रीट डिफ्यूजन मॉडल्स में जनरेशन क्वालिटी और इन्फरेंस एफिशिएंसी के बीच के ट्रेड-ऑफ को हल करता है।

मूल लेखक: Yuhang Chen, Xianfeng Wu, Jinhao Duan, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Parish Aggarwal, Frank Shyu, Luke Simon, Sandeep Pandey, Xi Liu, Tianlong Chen

प्रकाशित 2026-06-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhang Chen, Xianfeng Wu, Jinhao Duan, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Parish Aggarwal, Frank Shyu, Luke Simon, Sandeep Pandey, Xi Liu, Tianlong Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपको एक-एक करके गायब शब्दों को भरना है।

पुराना तरीका (ऑटोरेग्रेसिव - Autoregressive):
एक पारंपरिक AI लेखक को एक बहुत ही सावधान, धीमे लेखक (scribe) के रूप में सोचें। एक वाक्य लिखने के लिए, यह पहला शब्द लिखता है, फिर दूसरा, फिर तीसरा। यह तीसरे शब्द को तब तक नहीं लिख सकता जब तक इसे पहले दो शब्दों का पता न हो। यह पानी की बाल्टी लेकर एक कतार में खड़े लोगों की तरह है; आखिरी व्यक्ति को पानी तब तक नहीं मिल सकता जब तक कि उससे पहले वाले सभी लोग उसे आगे न बढ़ा दें। यह सटीक है, लेकिन धीमा है।

"डिफ्यूजन" (Diffusion) का तरीका (तेज़ लेकिन टूटा हुआ तरीका):
रफ़्तार बढ़ाने के लिए, शोधकर्ताओं ने "डिफ्यूजन" मॉडल का आविष्कार किया। कल्पना कीजिए कि एक शब्द एक समय में लिखने के बजाय, आपके पास टेक्स्ट का एक पूरा पन्ना है जहाँ अधिकांश शब्द काली स्याही (मास्क) से ढके हुए हैं। AI का काम एक ही समय में छिपे हुए सभी शब्दों का अनुमान लगाना है, फिर कुछ शब्दों को प्रकट करना, फिर से अनुमान लगाना और इसे तब तक दोहराना जब तक पन्ना साफ न हो जाए। यह एक टीम के चित्रकारों की तरह है जो एक साथ एक भित्ति चित्र (mural) के विभिन्न हिस्सों पर काम कर रहे हैं। यह बहुत तेज़ है!

बड़ी समस्या:
यहाँ एक पेच है। छिपे हुए शब्दों का सटीक अनुमान लगाने के लिए, AI को एक ही समय में पूरी तस्वीर देखने की आवश्यकता होती है।

  • "द्विदिश" (Bidirectional) समस्या: यदि AI शब्द का अनुमान लगाने के लिए पूरी तस्वीर (बाएं और दाएं दोनों तरफ) को देखता है, तो इसे बेहतरीन गुणवत्ता मिलती है। लेकिन, यह कार चलाने की तरह है जहाँ आपको लगातार रियरव्यू मिरर और विंडशील्ड दोनों को देखना पड़ता है। आप "फास्ट लेन" (जिसे KV Caching कहा जाता है) का उपयोग नहीं कर सकते क्योंकि हर बार जब आप आगे बढ़ते हैं, तो आपको उस पूरे रास्ते को फिर से स्कैन करना पड़ता है जिसे आप पहले ही चला चुके हैं। इससे जब बहुत सारे यात्री (बैच प्रोसेसिंग) होते हैं, तो कार फिर से धीमी हो जाती है।
  • "कारण संबंधी" (Causal) समस्या: फास्ट लेन का उपयोग करने के लिए, AI केवल उन शब्दों को देखता है जो उसने पहले ही लिखे हैं (बायां हिस्सा)। वह दाईं ओर की हर चीज़ को अनदेखा कर देता है। यह तेज़ है, लेकिन AI भविष्य के संदर्भ (context) के प्रति "अंधा" है, जिससे वह अक्सर मूर्खतापूर्ण गलतियाँ करता है क्योंकि उसे नहीं पता होता कि वाक्य कैसे समाप्त होगा।

समाधान: बाइफोकल डिफ्यूजन (The "Bifocal Glasses" Analogy - बाइफोकल चश्मे का उदाहरण)
लेखकों ने एक नया सिस्टम बनाया जिसे Bifocal dLLMs कहा जाता है। इसे बाइफोकल चश्मे की तरह समझें।

  1. मुख्य लेंस (Causal Attention): AI अपना मानक "बाईं आँख" वाला लेंस पहनता है। यह उन शब्दों को देखता है जिन्हें उसने पहले देखा है (बायां हिस्सा)। यह इसे "फास्ट लेन" (KV Caching) का पूरी तरह से उपयोग करने की अनुमति देता है। यह कुशल है और इसकी गति को ऊँचा बनाए रखता है।
  2. साइड लेंस (The R2LM Sidecar): यह जादुई ट्रिक है। मुख्य लेंस से एक छोटा, हल्का "दाईं आँख" वाला सहायक जुड़ा हुआ है। यह सहायक एक विशेष प्रकार का AI (जिसे Mamba SSM कहा जाता है) है जो उलटे क्रम में चलता है। यह तेज़ी से भविष्य के शब्दों (दाएं हिस्से) को स्कैन करता है और उस जानकारी को एक छोटे से नोट में संकुचित (compress) कर देता है।
  3. परिणाम: मुख्य AI को दोनों दुनियाओं का सर्वश्रेष्ठ मिलता है। यह बाएं हिस्से के लिए फास्ट लेन का उपयोग करता है, लेकिन इसे साइडकार के माध्यम से दाएं हिस्से से जानकारी की एक "फुसफुसाहट" भी मिलती है। इसे पूरे रास्ते को फिर से स्कैन करने के लिए रुकने की ज़रूरत नहीं है; यह बस उस नोट पर एक नज़र डाल लेता है।

उन्होंने इसका परीक्षण कैसे किया:
उन्होंने एक मानक AI मॉडल (Qwen3-1.7B) लिया और उसे यह "बाइफोकल" अपग्रेड दिया। उन्होंने इसे भारी मात्रा में टेक्स्ट (60 बिलियन टोकन) पर प्रशिक्षित किया।

परिणाम:

  • गति: जब एक साथ कई उपयोगकर्ताओं को सेवा दी जा रही थी (जैसे एक व्यस्त सर्वर), तो उनका नया मॉडल पुराने "सब कुछ देखने वाले" मॉडलों की तुलना में 2.4 से 12.9 गुना तेज़ था। यह मानक "धीमे लेखक" वाले मॉडलों से भी 1.9 से 2.9 गुना तेज़ था।
  • गुणवत्ता: भले ही यह तेज़ था, लेकिन इसने अपनी सटीकता नहीं खोई। वास्तव में, अधिकांश परीक्षणों में, इसने मानक "धीमे लेखक" से बेहतर लिखा और अक्सर "सब कुछ देखने वाले" मॉडलों के बराबर या उनसे बेहतर प्रदर्शन किया।
  • "प्लग-इन" फीचर: उन्होंने दिखाया कि आप एक मौजूदा, तैयार AI मॉडल को ले सकते हैं और बिना पूरे मॉडल को फिर से प्रशिक्षित किए बस इस साइडकार लेंस को "प्लग इन" कर सकते हैं। यह आश्चर्यजनक रूप से अच्छा रहा, जिससे साबित हुआ कि दोनों हिस्से (मुख्य लेंस और साइडकार) सहजता से एक साथ काम करते हैं।

सारांश में:
यह पेपर एक तरीका पेश करता है जिससे AI टेक्स्ट जनरेशन को तेज़ (फास्ट लेन को खुला रखकर) और स्मार्ट (भविष्य के संदर्भ की झलक पाकर बिना धीमे हुए) बनाया जा सके। वे इसे "बाइफोकल" कहते हैं क्योंकि, बाइफोकल चश्मे की तरह, यह पूरी तस्वीर को स्पष्ट रूप से देखने के लिए दो अलग-अलग तंत्रों का उपयोग करता है बिना सामान्य समझौतों (trade-offs) के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →