← नवीनतम पेपर
💬 NLP

CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection

कॉम्पैक्टअटेंशन (CompactAttention) एक ब्लॉक-यूनियन केवी सिलेक्शन (Block-Union KV Selection) तंत्र को पेश करके लॉन्ग-कॉन्टेक्स्ट लार्ज लैंग्वेज मॉडल्स में चंक्ड प्रीफिल (chunked prefill) को तेज़ करता है, जो 2D ब्लॉक-स्पार्स मास्क को कुशल, GQA-जागरूक प्रति-ग्रुप केवी ब्लॉक टेबल्स (per-group KV block tables) में परिवर्तित करता है, जिससे बिना किसी स्पष्ट कॉम्पैक्शन के इन-प्लेस मेमोरी एक्सेस सक्षम होता है और साथ ही डेंस सटीकता (near-dense accuracy) बनाए रखते हुए 2.72x तक की गति वृद्धि प्राप्त होती है।

मूल लेखक: Jiwon Song, Dongwon Jo, Beomseok Kang, Jae-Joon Kim

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiwon Song, Dongwon Jo, Beomseok Kang, Jae-Joon Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइब्रेरियन (AI) हैं जो किताबों के एक विशाल पुस्तकालय (संदर्भ/context) के आधार पर एक प्रश्न का उत्तर देने की कोशिश कर रहे हैं। अतीत में, यदि आपके पास एक बहुत बड़ा पुस्तकालय होता, तो आपको सही उत्तर खोजने के लिए हर एक किताब को पढ़ना पड़ता, जिसमें बहुत समय लगता। इसे तेज़ करने के लिए, शोधकर्ताओं ने एक "चंकड प्रीफिल" (chunked prefill) प्रणाली का आविष्कार किया: पूरी लाइब्रेरी को एक साथ पढ़ने के बजाय, आप इसे छोटे बैचों (chunks) में पढ़ते हैं, और जैसे-जैसे आप आगे बढ़ते हैं, एक नोटपैड (KV कैश) में नोट्स जोड़ते जाते हैं।

हालाँकि, एक नई समस्या उत्पन्न हुई: हर बार नया बैच मिलने पर, आप अपने नोटपैड में सही पन्ने जल्दी से कैसे ढूँढ सकते हैं बिना सब कुछ फिर से पढ़े?

यह पेपर CompactAttention पेश करता है, जो इस समस्या को हल करने का एक नया तरीका है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

पुराने तरीकों के साथ समस्या

पेपर ने पहचान की कि लोगों ने इसे हल करने के दो मुख्य तरीके आजमाए थे, और वे क्यों विफल रहे:

  1. "स्पार्स कर्नल" दृष्टिकोण (द इनएफिशिएंट स्कैनर - अक्षम स्कैनर):

    • विचार: कल्पना कीजिए कि आपके पास पुस्तकालय का एक नक्शा है जिसमें केवल महत्वपूर्ण किताबों को चिह्नित करने के लिए लाल बिंदु हैं। आप सफेद स्थानों को छोड़ने और केवल लाल बिंदुओं को देखने की कोशिश करते हैं।
    • विफलता: जब आप एक बहुत बड़ी लाइब्रेरी (लंबा संदर्भ) पढ़ रहे होते हैं लेकिन केवल एक बहुत छोटा सवाल (छोटा चंक) पूछ रहे होते हैं, तो यह तरीका धीमा हो जाता है। यह एक ऐसे स्कैनर की तरह है जो टेक्स्ट की पूरी दीवार को स्कैन करने के लिए तो बेहतरीन है, लेकिन जब आपके पास केवल एक वाक्य हो, तो स्कैनर को सेटअप करने और कैलिब्रेट करने में बहुत अधिक समय लगता है। "सफेद स्थान" को छोड़ने का ओवरहेड वास्तव में इसे सब कुछ पढ़ने की तुलना में धीमा बना देता है।
  2. "क्वेरी-सबसैम्पल्ड" दृष्टिकोण (द लेज़ी लाइब्रेरियन - आलसी लाइब्रेरियन):

    • विचार: हर सवाल की जाँच करने के बजाय, आप अपने बैच से कुछ यादृच्छिक (random) सवाल चुनते हैं, उन विशेष सवालों के लिए महत्वपूर्ण किताबें ढूंढते हैं, और यह मान लेते हैं कि वे किताबें सबके लिए महत्वपूर्ण हैं।
    • विफलता: यह जोखिम भरा है। यदि आप गलत कुछ सवाल चुन लेते हैं, तो आप एक महत्वपूर्ण किताब को मिस कर सकते हैं जिसकी आवश्यकता केवल एक विशिष्ट सवाल को थी। इसके अलावा, एक बार जब आप वे किताबें चुन लेते हैं, तो आपको उन्हें शेल्फ से एक विशेष मेज तक भौतिक रूप से ले जाना पड़ता है ताकि आप उन्हें पढ़ सकें। यह "ले जाना" (डेटा कॉपी करना) बहुत समय और ऊर्जा लेता है।

समाधान: CompactAttention

CompactAttention किताबों को ढूँढने और उन्हें पढ़ने को अलग करके खेल बदल देता है।

चरण 1: "यूनियन" रणनीति (खोज का समूहन)

एक जटिल "स्किप लिस्ट" (स्पार्स कर्नल) चलाने या कुछ सवालों के आधार पर अनुमान लगाने के बजाय, CompactAttention एक स्मार्ट ग्रुपिंग ट्रिक का उपयोग करता है:

  • कल्पना कीजिए कि एक केस पर काम करने वाली जासूसों (query heads) की एक टीम है। प्रत्येक जासूस के पास अपने "संदियाओं" (KV blocks) की अपनी सूची है जिन्हें वे महत्वपूर्ण समझते हैं।
  • प्रत्येक जासूस को अकेले काम करने देने के बजाय, CompactAttention कहता है: "आइए पूरे दल के सभी संदिग्धों को एक मास्टर लिस्ट में संयोजित करें।"
  • यह दो चरणों में किया जाता है:
    1. Q-Block Union: यह वर्तमान बैच के सभी सवालों के लिए सूचियों को संयोजित करता है।
    2. Intra-Group Union: यह उन जासूसों की सूचियों को संयोजित करता जो मिलकर काम करते हैं।
  • परिणाम: आपको संदिग्धों की एक एकल, न्यूनतम "मास्टर लिस्ट" प्राप्त होती है जो सभी की जरूरतों को पूरा करती है। कोई भी महत्वपूर्ण किताब पीछे नहीं छूटती क्योंकि यदि किसी भी जासूस को उसकी आवश्यकता थी, तो वह सूची में है।

चरण 2: "जीरो-कॉपी" निष्पादन (स्थान पर ही पढ़ना)

यही जादू वाला हिस्सा है।

  • पुराना तरीका: एक बार जब आपके पास अपनी मास्टर लिस्ट आ जाती है, तो आपको उन सभी किताबों को शेल्फ से एक विशेष मेज पर भौतिक रूप से ले जाना पड़ता है ताकि आप उन्हें तेज़ी से पढ़ सकें। इस "ले जाने" में समय लगता है।
  • CompactAttention का तरीका: आप किताबों को बिल्कुल नहीं हिलाते। आप बस लाइब्रेरियन को एक नक्शा (मेटाडेटा) देते हैं जो कहता है, "शेल्फ A, रो 3, बुक 5 पर जाएँ; फिर शेल्फ B, रो 2, बुक 1 पर जाएँ।"
  • लाइब्रेरियन (कंप्यूटर कर्नल) सीधे उन स्थानों पर जाता है और उन्हें पढ़ता है। इसे "जीरो-कॉपी पेज्ड अटेंशन" (Zero-Copy Paged Attention) कहा जाता है। यह डेटा को इधर-उधर ले जाने में लगने वाले सारा समय और ऊर्जा बचाता है।

यह एक बड़ी बात क्यों है

पेपर ने एक विशाल AI मॉडल (LLaMA-3.1-8B) पर परीक्षण किया, जिसका संदर्भ 128,000 शब्दों (एक बहुत लंबा दस्तावेज़) का था।

  • सटीकता (Accuracy): यह पूरी लाइब्रेरी पढ़ने (Dense Attention) जितना ही स्मार्ट था। इसने कोई भी महत्वपूर्ण विवरण मिस नहीं किया।
  • गति (Speed): यह मानक तरीके की तुलना में 2.72 गुना तक तेज़ था।

मुख्य निष्कर्ष (The Takeaway)

CompactAttention को एक स्मार्ट लाइब्रेरियन के रूप में समझें जो पुस्तकालय को पुनर्व्यवस्थित करने की कोशिश करने के बजाय, बस एक सटीक, संयुक्त इंडेक्स कार्ड का उपयोग करता है।

यह महसूस करते हुए कि "खोज" (महत्वपूर्ण ब्लॉक्स को ढूंढना) और "निष्पादन" (उन्हें पढ़ना) को अलग किया जाना चाहिए, और एक "ग्रुपिंग" ट्रिक का उपयोग करके यह सुनिश्चित करना कि कुछ भी छूटे नहीं, उन्होंने लंबे दस्तावेज़ों को प्रोसेस करने वाली AI को बिना उसकी बुद्धिमत्ता खोए काफी तेज़ बना दिया। उन्होंने साबित किया कि बाधा केवल यह नहीं थी कि कौन सी किताबें चुननी हैं, बल्कि यह भी थी कि आप उन्हें चुनने के तरीके में कैसे सुधार कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →