← नवीनतम पेपर
💬 NLP

Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection

यह शोध पत्र टोकन स्पार्स अटेंशन (Token Sparse Attention) का प्रस्ताव करता है, जो एक गतिशील और प्रतिवर्ती (reversible) टोकन-स्तरीय स्पर्सिफिकेशन तंत्र है जो न्यूनतम सटीकता ह्रास के साथ लॉन्ग-कॉन्टेक्स्ट LLMs के लिए महत्वपूर्ण इन्फरेंस स्पीडअप प्राप्त करने हेतु अटेंशन के दौरान की-वैल्यू पेयर्स को कंप्रेस और डीकंप्रेस करता है।

मूल लेखक: Dongwon Jo, Beomseok Kang, Jiwon Song, Jae-Joon Kim

प्रकाशित 2026-05-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dongwon Jo, Beomseok Kang, Jiwon Song, Jae-Joon Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ही सवाल का जवाब पाने के लिए 1,00,000 पन्नों का एक विशाल उपन्यास पढ़ने की कोशिश कर रहे हैं। आपका मस्तिष्क (AI मॉडल) सही सुराग खोजने के लिए हर पन्ने को बार-बार देखना और समझना चाहता है। समस्या यह है कि जैसे-जैसे किताब लंबी होती जाती है, उसे पढ़ने का प्रयास थोड़ा ही नहीं बढ़ता, बल्कि बहुत अधिक बढ़ जाता है। यदि किताब का आकार दोगुना हो जाता है, तो प्रयास चार गुना हो जाता है। यह "क्वाड्रेटिक कॉम्प्लेक्सिटी" (quadratic complexity) की बाधा है जो लंबी कहानियों को कंप्यूटर के लिए तेज़ी से प्रोसेस करना कठिन बना देती है।

यह शोध पत्र एक नई तकनीक पेश करता है जिसे Token Sparse Attention कहा जाता है। इसे एक स्मार्ट, गतिशील "स्किमिंग" (ऊपर-ऊपर से पढ़ने) की रणनीति के रूप में समझें जो AI को कहानी का सार खोए बिना इस तरह से पढ़ने में मदद करती है कि वह तेज़ हो सके।

यह इस प्रकार काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. पुराने तरीकों के साथ समस्या: "स्थायी कूड़ेदान" (The Permanent Trash Can)

पिछले तरीकों ने गति बढ़ाने के लिए यह तय करने की कोशिश की कि, "यह पन्ना उबाऊ है, चलो इसे हमेशा के लिए कूड़ेदान में डाल देते हैं।"

  • दोष: कल्पना कीजिए कि आप एक रहस्यमयी उपन्यास पढ़ रहे हैं। शुरुआत में, "बटलर" नामक एक पात्र महत्वहीन लगता है, इसलिए आप उसका पन्ना कूड़ेदान में डाल देते हैं। लेकिन 500 पन्नों के बाद, बटलर मुख्य गवाह बन जाता है! क्योंकि आपने उस पन्ने को स्थायी रूप से हटा दिया था, AI उत्तर नहीं खोज पाता।
  • शोध पत्र की आलोचना: पुराने तरीके बहुत जल्दी अपरिवर्तनीय निर्णय ले लेते हैं। वे यह भी मान लेते हैं कि मस्तिष्क के सभी हिस्से (जिन्हें "अटेंशन हेड्स" कहा जाता है) एक समान हैं, जबकि मस्तिष्क के अलग-अलग हिस्से अलग-अलग समय पर अलग-अलग पात्रों पर ध्यान दे सकते हैं।

2. नया समाधान: "जादुई बुकमार्क" (The Magic Bookmark)

पन्नों को फेंकने के बजाय, Token Sparse Attention एक "जादुई बुकमार्क" प्रणाली का उपयोग करता है।

  • चरण 1: त्वरित स्कैन (कंप्रेशन/संपीड़न): एक अध्याय पढ़ने से पहले, AI पूरी किताब को जल्दी से स्कैन करता है और केवल उन 10% पन्नों को चुनता है जो अभी सबसे महत्वपूर्ण लग रहे हैं। यह अपनी ऊर्जा केवल उन्हीं पन्नों पर केंद्रित करता है।
  • चरण 2: गहन अध्ययन (Deep Dive): यह उन चुने हुए पन्नों को बहुत ध्यान से और तेज़ी से पढ़ता है।
  • चरण 3: रीसेट (डीकंप्रेशन/विसंपीड़न): यहाँ जादू है। पढ़ने के बाद, यह पन्नों को उनके मूल क्रम में वापस किताब में रख देता है। यह कुछ भी हटाता नहीं है।
  • यह क्यों मायने रखता है: अगले अध्याय में, AI फिर से पूरी किताब देख सकता है। यदि "बटलर" वाला पन्ना पहले उबाऊ था लेकिन अब महत्वपूर्ण है, तो AI इस बार उसे उठा सकता है। यह AI को अपना मन बदलने और कहानी के आगे बढ़ने के साथ-डे-डे महत्वपूर्ण चीज़ों का पुनर्मूल्यांकन करने की अनुमति देता है।

3. अलग-अलग दिमाग, अलग-अलग फोकस

शोध पत्र यह भी बताता है कि AI के पास समानांतर में काम करने वाले कई "मिनी-दिमाग" (अटेंशन हेड्स) होते हैं।

  • उपमा: जासूसी टीम की कल्पना करें जो एक मामले पर काम कर रही है। जासूस A पदचिह्नों (footprints) की तलाश कर रहा है, जबकि जासूस B उंगलियों के निशान (fingerprints) की तलाश कर रहा है।
  • पुराना तरीका: टीम लीडर सभी को उन्हीं 10 पन्नों को देखने के लिए मजबूर करता है। जासूस A पदचिह्नों को मिस कर देता है क्योंकि वे उन पन्नों पर थे जिन्हें टीम ने अनदेखा कर दिया था।
  • नया तरीका: जासूस A पदचिह्नों वाले पन्ने चुनता है; जासूस B उंगलियों के निशान वाले पन्ने चुनता है। वे अपने विशिष्ट पन्नों के सेट पर काम करते हैं, लेकिन उन्हें अगले दौर के लिए पूरी किताब फिर से देखने का मौका मिलता है। यह टीम को बहुत अधिक कुशल और सटीक बनाता है।

4. सही परतों (Layers) का चयन करना

शोध पत्र ने यह भी खोजा कि आपको किताब के हर एक अध्याय में यह "स्किमिंग" करने की आवश्यकता नहीं है।

  • खोज: कुछ अध्याय बहुत स्थिर होते हैं (कथानक में ज्यादा बदलाव नहीं होता), जबकि अन्य अराजक (chaotic) होते हैं।
  • रणनीति: यह विधि मापती है कि एक अध्याय से दूसरे अध्याय में "कहानी" कितनी बदलती है। यह स्किमिंग के इस तरीके को केवल उन स्थिर अध्यायों में लागू करती है जहाँ यह सुरक्षित है। यह अराजक, महत्वपूर्ण अध्यायों को वैसे ही छोड़ देती है ताकि कुछ भी छूटे नहीं।

परिणाम

इस "कंप्रेस, रीड, फिर डीकंप्रेस" पद्धति का उपयोग करके, लेखकों ने दिखाया कि:

  • गति: AI 128,000 टोकन (एक बहुत लंबी संदर्भ सीमा) को 3.2 गुना तेज़ी से पढ़ सकता है।
  • सटीकता: इसकी सटीकता में बहुत कम गिरावट आती है (1% से भी कम)। यह ऐसा है जैसे आप किताब को 3 गुना तेज़ी से पढ़ रहे हैं लेकिन फिर भी लगभग सब कुछ याद रखते हैं।
  • अनुकूलता: यह तकनीक मौजूदा तेज़ पढ़ने वाले टूल्स (जैसे Flash Attention) के ऊपर काम करती है, जिससे यह वर्तमान AI सिस्टम के लिए एक 'प्लग-एंड-प्ले' अपग्रेड बन जाती है।

संक्षेप में, Token Sparse Attention AI को एक सुपरपावर देने जैसा है: एक विशाल दस्तावेज़ के सबसे महत्वपूर्ण हिस्सों को जल्दी से पढ़ने (skim करने) की क्षमता, ताकि समय बचाया जा सके, जबकि पूरे दस्तावेज़ को मेमोरी में सुरक्षित रखा जाए ताकि यदि वे बाद में महत्वपूर्ण हो जाएं, तो विवरण को फिर से पढ़ा जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →