← नवीनतम पेपर
💬 NLP

LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models

यह शोध पत्र LoSA का प्रस्ताव करता है, जो एक लोकैलिटी-अवेयर (locality-aware) स्पार्स अटेंशन मैकेनिज्म है जो स्थिर टोकन के लिए कैश किए गए अटेंशन परिणामों का पुन: उपयोग करके और केवल सक्रिय टोकन पर स्पार्स अटेंशन लागू करके ब्लॉक-वाइज़ डिफ्यूजन लैंग्वेज मॉडल्स को त्वरित करता है, जिससे KV इन्फ्लेशन (KV inflation) पर काबू पाकर लॉन्ग-कॉन्टेक्स्ट परिदृश्यों में महत्वपूर्ण गति और बेहतर सटीकता प्राप्त की जा सकती है।

मूल लेखक: Haocheng Xi, Harman Singh, Yuezhou Hu, Coleman Hooper, Rishabh Tiwari, Aditya Tomar, Minjae Lee, Wonjun Kang, Michael Mahoney, Chenfeng Xu, Kurt Keutzer, Amir Gholami

प्रकाशित 2026-04-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haocheng Xi, Harman Singh, Yuezhou Hu, Coleman Hooper, Rishabh Tiwari, Aditya Tomar, Minjae Lee, Wonjun Kang, Michael Mahoney, Chenfeng Xu, Kurt Keutzer, Amir Gholami

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी कहानी लिखने की कोशिश कर रहे हैं, लेकिन एक सामान्य व्यक्ति की तरह एक-एक शब्द लिखने के बजाय, आप एक बार में 16 शब्दों के ब्लॉक्स में लिख रहे हैं। आप उन 16 शब्दों को अंतिम रूप देने से पहले किसी भी क्रम में पुनर्व्यवस्थित कर सकते हैं। ब्लॉक-वाइज़ डिफ्यूजन लैंग्वेज मॉडल्स (DLMs) इसी तरह काम करते हैं। वे शक्तिशाली हैं क्योंकि वे टेक्स्ट के एक पूरे हिस्से के बारे में एक साथ "सोच" सकते हैं, जो जटिल तर्क (reasoning) के लिए बहुत अच्छा है।

हालाँकि, एक बड़ी समस्या है: मेमोरी ट्रैफिक (Memory Traffic)।

समस्या: "भीड़ भरी बस" का प्रभाव

इन ब्लॉक्स को लिखने के लिए, मॉडल को यह याद रखने की आवश्यकता है कि उसने पहले क्या लिखा था (जिसे "प्रिफिक्स" कहा जाता है)। कंप्यूटर की भाषा में, इसे KV कैश (KV Cache) कहा जाता है।

जब मॉडल एक नया ब्लॉक लिखने की कोशिश करता है, तो उसे आगे क्या आना चाहिए यह तय करने के लिए पिछले सभी शब्दों को देखना पड़ता है।

  • नाइव दृष्टिकोण (The Naïve Approach): कल्पना कीजिए कि आपके पास 16 यात्रियों वाली एक बस है (आपके नए ब्लॉक के 16 शब्द)। प्रत्येक यात्री यह तय करने के लिए कि उन्हें क्या कहना है, बस के पीछे की एक विशिष्ट सीट को देखना चाहता है (पिछला टेक्स्ट)।
  • इन्फ्लेशन की समस्या: यदि यात्री 1 सीट 5 को देखता है, यात्री 2 सीट 100 को देखता है, और यात्री 3 सीट 500 को देखता है, तो बस ड्राइवर को उन सभी अलग-अलग सीटों को खोलने के लिए रुकना होगा ताकि हर कोई उन्हें चेक कर सके। भले ही प्रत्येक व्यक्ति ने केवल एक सीट देखी हो, समूह को संतुष्ट करने के लिए बस को 16 अलग-अलग सीटों को लोड करना पड़ा। इसे KV इन्फ्लेशन (KV Inflation) कहा जाता है। यह धीमा है और बहुत अधिक ऊर्जा बर्बाद करता है।

अंतर्दृष्टि: "शांत कक्षा"

शोधकर्ताओं ने गौर किया कि ये मॉडल कैसे काम करते हैं। जब मॉडल शब्दों के एक ब्लॉक को अपडेट करता है, तो अधिकांश शब्द बहुत अधिक नहीं बदलते हैं।

इसे एक कक्षा की तरह सोचें:

  • सक्रिय टोकन (Active Tokens): कुछ छात्र हाथ उठा रहे हैं, चिल्ला रहे हैं और अपने उत्तर बदल रहे हैं। वे "सक्रिय" हैं।
  • स्थिर टोकन (Stable Tokens): अन्य 14 छात्र शांति से बैठे हैं। उनके उत्तर पिछली बार जब आपने जांच की थी, तब से बदले नहीं हैं। वे "स्थिर" हैं।

यदि आप शांत छात्रों से पूछते हैं, "अब तक की कहानी के बारे में आपका क्या विचार है?" तो वे आपको ठीक वही उत्तर देंगे जो उन्होंने एक सेकंड पहले दिया था। उन्हें फिर से पूछने की कोई आवश्यकता नहीं है!

समाधान: LoSA (लोकेलिटी-अवेयर स्पार्स अटेंशन)

यह शोध पत्र LoSA (Locality-Aware Sparse Attention) नामक एक विधि पेश करता है। यह एक स्मार्ट शिक्षक की तरह है जो कक्षा का कुशलतापूर्वक प्रबंधन करता है।

LoSA कैसे काम करता है, इसके चरण यहाँ दिए गए हैं:

  1. सक्रिय छात्रों को पहचानें: सबसे पहले, LoSA जल्दी से जाँच करता है कि कौन से छात्र (टोकन) वास्तव में अपने विचार बदल रहे हैं। यह शांत छात्रों को अनदेखा कर देता है।
  2. शांत उत्तरों का पुन: उपयोग करें: "स्थिर टोकन" (शांत छात्रों) के लिए, LoSA उन्हें फिर से बस के पीछे देखने के लिए नहीं कहता है। यह बस पिछले बार दिए गए उनके उत्तर का पुन: उपयोग करता है। यह ऐसा ही है जैसे कहना, "आपने अपना विचार नहीं बदला, इसलिए मैं वही लिख दूँगा जो आपने पहले कहा था।"
  3. सक्रिय लोगों पर ध्यान केंद्रित करें: LoSA केवल "सक्रिय टोकन" (जो बदल रहे हैं) को बस के पीछे देखने के लिए भेजता है।
  4. परिणाम: क्योंकि केवल कुछ ही लोग देख रहे हैं, बस ड्राइवर को केवल सीटों के एक छोटे समूह के लिए दरवाजे खोलने पड़ते हैं।

यह गेम चेंजर क्यों है

  • गति (Speed): हर शब्द के लिए सीटों की पूरी बस को लोड न करने के कारण, मॉडल मानक ग्राफिक्स कार्ड पर 4.14 गुना तेज़ चलता है।
  • स्मार्टर (Smarter): क्योंकि "शांत" छात्रों के पास अभी भी कहानी की उनकी पूरी स्मृति होती है (इसके बजाय कि उन्हें मेमोरी के एक छोटे से हिस्से के आधार पर अनुमान लगाने के लिए मजबूर किया जाए), वे वास्तव में अन्य तरीकों की तुलना में बेहतर कहानियाँ लिखते हैं जो बहुत अधिक स्पार्स (sparse) होने की कोशिश करते हैं।
  • दक्षता (Efficiency): यह 1.5 गुना कम मेमोरी ट्रैफिक का उपयोग करता है, जिसका अर्थ है कि कंप्यूटर को डेटा इधर-उधर ले जाने के लिए बहुत अधिक मेहनत नहीं करनी पड़ती है।

उपमा सारांश (Analogy Summary)

  • पुराना तरीका (Naïve Sparse Attention): 16 लोगों को लाइब्रेरी के 16 अलग-अलग स्थानों को देखने के लिए कहना। लाइब्रेरियन को किताबें लेने के लिए 16 अलग-अलग शेल्फों तक दौड़ना पड़ता है। यह अराजक और धीमा है।
  • LoSA: यह महसूस करना कि उनमें से 14 लोग उसी पन्ने को पढ़ रहे हैं जिसे वे एक सेकंड पहले पढ़ रहे थे। आप उनसे कहते हैं, "जो आपके पास है उसे पढ़ते रहें।" आप केवल उन 2 लोगों को लाइब्रेरियन के पास भेजते हैं जो पन्ने पलट रहे हैं। लाइब्रेरियन को केवल 2 शेल्फों तक दौड़ना पड़ता है।

संक्षेप में: LoSA एआई मॉडल्स को तेज़ और स्मार्ट बनाता है क्योंकि यह इस बात को समझता है कि अधिकांश समय, एआई केवल वही दोहरा रहा होता है जो वह पहले से जानता है, इसलिए उसे बार-बार उन्हीं चीजों को चेक करने में ऊर्जा बर्बाद नहीं करनी चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →