← नवीनतम पेपर
💬 NLP

DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention

DashAttention, α\alpha-entmax का उपयोग करके परिवर्तनीय संख्या में KV ब्लॉक्स को गतिशील रूप से चुनने के लिए एक पूर्णतः विभेदनीय (differentiable) और अनुकूलन योग्य विरल पदानुक्रमित अटेंशन (sparse hierarchical attention) तंत्र पेश करता है, जो NSA और InfLLMv2 जैसी मौजूदा विधियों की तुलना में बेहतर लॉन्ग-कॉन्टेक्स्ट मॉडलिंग सटीकता और इन्फरेंस गति प्राप्त करता है।

मूल लेखक: Yuxiang Huang, Nuno M. T. Gonçalves, Federico Alvetreti, Lei Li, Xu Han, Edoardo M. Ponti, André F. T. Martins, Marcos V. Treviso

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxiang Huang, Nuno M. T. Gonçalves, Federico Alvetreti, Lei Li, Xu Han, Edoardo M. Ponti, André F. T. Martins, Marcos V. Treviso

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अकेले प्रश्न का उत्तर खोजने के लिए एक विशाल, 1,00,000 पृष्ठों के विश्वकोश (encyclopedia) को पढ़ने की कोशिश कर रहे हैं।

समस्या: "सब कुछ" बनाम "Top-K" की दुविधा
वर्तमान AI मॉडल (लार्ज लैंग्वेज मॉडल्स) आमतौर पर इसे दो तरीकों से संभालते हैं, जिनमें दोनों की अपनी कमियां हैं:

  1. "सब कुछ पढ़ने" वाला दृष्टिकोण (Full Attention): मॉडल उत्तर खोजने के लिए विश्वकोश के हर एक शब्द को पढ़ने की कोशिश करता है। यह सटीक तो है लेकिन अविश्वसनीय रूप से धीमा और महंगा है, जैसे केवल एक रेसिपी खोजने के लिए पूरी किताब पढ़ डालना।
  2. "टॉप 5 चुनने" वाला दृष्टिकोण (Top-K Sparse Attention): मॉडल तेजी से विषय-सूची (table of contents) को स्कैन करता है, उन शीर्ष 5 अध्यायों को चुनता है जो उसे लगता है कि प्रासंगिक हैं, और बाकी को अनदेखा कर देता है। यह तेज़ है, लेकिन कठोर है। क्या होगा यदि उत्तर वास्तव में अध्याय 6 में है? या क्या होगा यदि उत्तर के लिए 20 अलग-अलग बिखरे हुए पृष्ठों को पढ़ने की आवश्यकता है? साथ भी, एक बार जब मॉडल उन 5 अध्यायों को चुन लेता है, तो वह उन अध्यायों से "सीख" नहीं सकता जिन्हें उसने अनदेखा कर दिया था, जिससे प्रशिक्षण (training) की प्रक्रिया जटिल हो जाती है।

समाधान: DashAttention
इस शोध पत्र के लेखक DashAttention नामक एक नई विधि प्रस्तावित करते हैं। DashAttention को एक स्मार्ट, अनुकूलन योग्य (adaptive) लाइब्रेरियन के रूप में समझें जो केवल निश्चित संख्या में किताबें नहीं चुनता, बल्कि यह तय करता है कि प्रश्न की जटिलता के आधार पर उसे कितनी किताबों को पढ़ने की आवश्यकता है।

DashAttention इस प्रकार कार्य करता है, जिसे तीन चरणों में एक सरल उपमा (analogy) के माध्यम से समझाया गया है:

चरण 0: "अध्याय सारांश" (Local Chunk Summarization)

तुरंत हर एक शब्द को देखने के बजाय, मॉडल पहले विशाल पाठ को छोटे "चंक्स" (जैसे अध्यायों) में तोड़ देता है।

  • पुराना तरीका: पहले यह एक अध्याय के सभी शब्दों का औसत ले लेता था (जैसे यह कहना कि "यह अध्याय मुख्य रूप से बिल्लियों के बारे में है")।
  • DashAttention का तरीका: यह एक सूक्ष्म, सीखे हुए "रीडर" का उपयोग करता है जो अध्याय को स्कैन करता है और एक स्मार्ट, सूक्ष्म सारांश लिखता है। यह एक मानव लाइब्रेरियन की तरह है जो एक अध्याय को पढ़ता है और एक 2-वाक्य का सारांश लिखता है जो केवल औसत बताने के बजाय उसके सार को पकड़ता है। महत्वपूर्ण रूप से, यह सारांश लचीला है; यदि मॉडल प्रशिक्षण (training) शुरू करता है, तो वह बेहतर सारांश लिखना सीख जाता है।

चरण 1: "अनुकूलन योग्य गेटकीपर" (Entmax Routing)

अब, मॉडल के पास अध्यायों के सारांशों की एक सूची है। उसे यह तय करना है कि किन अध्यायों को विस्तार से पढ़ना है।

  • पुराना तरीका (Top-K): मॉडल का एक सख्त नियम होता है: "हमेशा ठीक 5 अध्याय चुनें।" यदि प्रश्न सरल है, तो वह 5 अध्याय पढ़ने में समय बर्बाद करता है। यदि प्रश्न कठिन है, तो वह महत्वपूर्ण जानकारी खो देता है क्योंकि वह 5 पर सीमित है।
  • DashAttention का तरीका: मॉडल α\alpha-entmax नामक एक विशेष गणितीय उपकरण का उपयोग करता है। एक गेटकीपर की कल्पना करें जो प्रश्न और सारांशों को देखता है।
    • यदि प्रश्न सरल है ("फ्रांस की राजधानी क्या है?"), तो गेटकीपर कहता है, "केवल 1 अध्याय की आवश्यकता है," और बाकी को बाहर कर देता है।
    • यदि प्रश्न जटिल है ("तीन महाद्वीपों में व्यापार मार्गों के इतिहास का पता लगाएं"), तो गेटकीपर कहता है, "ठीक है, हमें 15 अध्यायों की आवश्यकता है," और द्वार को अधिक खोल देता है।
    • जादू: यह गेटकीपर "डिफरेंशिएबल" (differentiable) है। इसका अर्थ है कि मॉडल एक बेहतर गेटकीपर कैसे बनना है, यह सीख सकता है। यदि यह प्रशिक्षण के दौरान गलत अध्याय चुनता है, तो इसे अपनी गेटकीपिंग रणनीति को समायोजित करने के लिए एक संकेत मिलता है। यह कोई सख्त "हाँ/नहीं" वाला स्विच नहीं है; यह एक सुचारू, सीखने योग्य डायल है।

चरण 2: "गहन अध्ययन" (Prior-Induced Sparse Softmax)

अंत में, मॉडल गेटकीपर द्वारा चयनित विशिष्ट अध्यायों को पढ़ता है।

  • यह गेटकीपर से मिले "मतों" (votes) को लेता है और चुनी गई सामग्री के विस्तृत अध्ययन के लिए उनका उपयोग करता है।
  • यह सुनिश्चित करता है कि भले ही इसने अधिकांश पुस्तक को छोड़ दिया हो, फिर भी यह कहानी के प्रवाह को न खोए। यह अंतराल को इस तरह भरता है कि अंतिम उत्तर उतना ही सटीक हो जितना कि पूरी किताब पढ़ने से होता, लेकिन इसने यह बहुत तेज़ी से किया।

यह बेहतर क्यों है? (परिणाम)

शोध पत्र का दावा है कि DashAttention तीन प्रमुख क्षेत्रों में जीतता है:

  1. स्मार्ट चयन: कठोर "टॉप-5" नियम के विपरीत, DashAttention अनुकूलित होता है। यह कठिन प्रश्नों पर अधिक "मस्तिष्क शक्ति" खर्च करता है और आसान प्रश्नों पर कम। यह इसे ढेर में से विशिष्ट सुई खोजने (retrieval tasks) में बहुत बेहतर बनाता है।
  2. कोई "बिखराव" नहीं (No Dispersion): लंबे टेक्स्ट में, मानक AI मॉडल अक्सर "विचलित" हो जाते हैं और अपना ध्यान बहुत अधिक फैला देते हैं, जैसे कि टॉर्च की रोशनी का बहुत चौड़ा होना जिससे कुछ भी स्पष्ट दिखाई न दे। DashAttention ध्यान को केंद्रित रखता है, यह सुनिश्चित करता है कि भारी मात्रा में टेक्स्ट होने पर भी मॉडल सटीक बना रहे।
  3. गति: क्योंकि यह अप्रासंगिक हिस्सों को पढ़ने से बच जाता है, इसलिए यह अविश्वसनीय रूप से तेज़ है।
    • लेखकों ने कंप्यूटर चिप्स (GPUs) के लिए एक विशेष संस्करण बनाया है जो बहुत लंबे टेक्स्ट के साथ काम करते समय वर्तमान उद्योग मानक (FlashAttention-3) की तुलना में 3.36 गुना तेज़ चलता है।
    • यह वही सटीकता प्राप्त करता है जो पूरी किताब पढ़ने से मिलती है, लेकिन केवल 25% कंप्यूटिंग पावर (75% स्पर्सिटी) का उपयोग करता है।

सारांश

DashAttention एक कठोर, नियम-बद्ध लाइब्रेरियन से एक अत्यधिक बुद्धिमान, अनुकूलन योग्य सहायक में अपग्रेड करने जैसा है जो हमेशा 5 किताबें चुनता है, बल्कि एक ऐसा सहायक है जो विषय-सूची पढ़ता है, यह तय करता है कि विशिष्ट प्रश्न के लिए कितने अध्यायों की आवश्यकता है, और फिर केवल उन्हीं में गहराई से उतरता है। यह पिछले तरीकों की तुलना में तेज़, स्मार्ट और बेहतर सीखने वाला है, जिससे यह संभव हो जाता है कि AI भारी मात्रा में जानकारी को बिना अभिभूत हुए या धीमे हुए संभाल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →