← नवीनतम पेपर
💬 NLP

EntmaxKV: Support-Aware Decoding for Entmax Attention

EntmaxKV एक सपोर्ट-अवेयर स्पार्स डिकोडिंग फ्रेमवर्क है जो इन्फरेंस से पहले KV कैश पेजों को चुनिंदा रूप से लोड करने के लिए α\alpha-entmax अटेंशन की सटीक स्पर्सिटी का लाभ उठाता है, जिससे मेमोरी ट्रैफिक काफी कम हो जाता है और फुल-कैश बेसलाइन्स के समान सटीकता बनाए रखते हुए लॉन्ग-कॉन्टेक्स्ट जनरेशन में पर्याप्त स्पीडअप प्राप्त होता है।

मूल लेखक: Gonçalo Duarte, Miguel Couceiro, Marcos V. Treviso

प्रकाशित 2026-05-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gonçalo Duarte, Miguel Couceiro, Marcos V. Treviso

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ EntmaxKV पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी समस्या: "अनंत पुस्तकालय" की बाधा (The "Infinite Library" Bottleneck)

कल्पना कीजिए कि आप एक लाइब्रेरियन (AI मॉडल) हैं जो एक कहानी लिखने की कोशिश कर रहे हैं। जैसे-जैसे आप हर नया वाक्य लिखते हैं, आपको यह सुनिश्चित करने के लिए कि नया वाक्य सही अर्थ दे रहा है, पहले लिखी गई हर चीज़ को पीछे मुड़कर देखना पड़ता है।

एक मानक AI में, यह "याददाश्त" (memory) एक बढ़ते हुए पुस्तकालय की तरह है। हर बार जब आप एक नया शब्द लिखते हैं, तो पुस्तकालय एक किताब और बड़ा हो जाता है।

  • समस्या: जब कहानी बहुत लंबी हो जाती है (लाखों शब्द), तो पुस्तकालय विशाल हो जाता है।
  • बाधा (Bottleneck): अगला शब्द लिखने के लिए, लाइब्रेरियन को शेल्फ तक दौड़ना पड़ता है, पुस्तकालय की हर एक किताब को उठाना पड़ता है, उनके स्पाइन (spine) को पढ़ना पड़ता है, और तय करना पड़ता है कि कौन सी प्रासंगिक (relevant) हैं। भले ही 99% किताबें अप्रासंगिक हों, लाइब्रेरियन को उन्हें शारीरिक रूप से हिलाना ही पड़ेगा। इससे बहुत समय और ऊर्जा लगती है, जिससे सब कुछ धीमा हो जाता है।

पुराना समाधान: "Softmax" ("सबको टिकट देने" वाला दृष्टिकोण)

वर्तमान AI मॉडल Softmax नामक विधि का उपयोग करते हैं।

  • यह कैसे काम करता है: जब लाइब्रेरियन पुस्तकालय को देखता है, तो Softmax हर एक किताब को एक छोटा, गैर-शून्य (non-zero) "टिकट" (एक प्रायिकता स्कोर) देता है। "ब्रेड कैसे बनाएं" वाली किताब को भी एक छोटा टिकट मिलता है, भले ही कहानी "अंतरिक्ष यात्रा" के बारे में हो।
  • दोष: क्योंकि हर किताब के पास एक टिकट है, लाइब्रेरियन अप्रासंगिक किताबों को अनदेखा नहीं कर सकता। उन्हें चेक करने के लिए उन सभी को कमरे में लाना ही पड़ता है। यदि वे समय बचाने के लिए अप्रासंगिक किताबों को छोड़ने की कोशिश करते हैं, तो वे अनजाने में उन छोटे टिकटों को फेंक देते हैं जो Softmax ने दिए थे, जिससे गणित बिगड़ जाता है और कहानी खराब हो जाती है।
  • परिणाम: यह घास के ढेर में सुई खोजने जैसा है, जहाँ आप घास के हर एक तिनके को देखते हैं, भले ही आप जानते हों कि सुई केवल एक छोटे से कोने में है।

नया विचार: "Entmax" ("सटीक शून्य" वाला दृष्टिकोण)

लेखक α\alpha-entmax नामक एक नया गणितीय उपकरण पेश करते हैं।

  • जादुई ट्रिक: Softmax के विपरीत, Entmax सख्त है। यदि कोई किताब प्रासंगिक नहीं है, तो उसे बिल्कुल शून्य टिकट मिलता है। यह "छोटा" नहीं है; यह कुछ भी नहीं है।
  • लाभ: यदि किसी किताब के पास शून्य टिकट है, तो वह कहानी में बिल्कुल भी योगदान नहीं देती है। आप उसे बिना परिणाम बदले बाहर निकाल सकते हैं।
  • लक्ष्य: "घास के ढेर" का अनुमान लगाने के बजाय, लक्ष्य विशिष्ट "सुई" (support) को खोजना बन जाता है। यदि आप उन कुछ किताबों को खोज लेते हैं जिनके पास गैर-शून्य टिकट हैं, तो आपको बाकी पुस्तकालय को देखने की आवश्यकता नहीं है।

समाधान: EntmaxKV ("स्मार्ट लाइब्रेरियन")

पेपर EntmaxKV का प्रस्ताव देता है, जो इस "सटीक शून्य" (Exact Zero) गुण का उपयोग करके गति बढ़ाने के लिए बनाया गया है। यह कैसे काम करता है, यहाँ चरण-दर-चरण दिया गया है:

1. "बॉक्स" की जाँच (Query-Aware Page Scoring)

कल्पना कीजिए कि पुस्तकालय की किताबें ढीली नहीं हैं; वे बक्सों (पेज) में रखी गई हैं।

  • बॉक्स के अंदर की किताबें पढ़ने के लिए लाइब्रेरियन द्वारा बॉक्स खोलने से पहले, वे बॉक्स पर लगे लेबल को देखते हैं।
  • लेबल में किताबों का एक "सारांश" (न्यूनतम और अधिकतम स्कोर) होता है।
  • लाइब्रेरियन पूछता है: "क्या इस बॉक्स में किसी किताब का प्रासंगिक होने की संभावना है?"
  • यदि उत्तर "नहीं" है (बॉक्स निश्चित रूप से अप्रासंगिक है), तो लाइब्रेरियन बॉक्स कभी नहीं खोलता। वे शेल्फ तक जाने और उसे बाहर खींचने का समय बचा लेते हैं।

2. "Gaussian" का अनुमान (Gaussian-Aware Selector)

कभी-कभी, बॉक्स का लेबल पर्याप्त नहीं होता। लेखकों ने एक चतुर अनुमान लगाने वाला खेल जोड़ा है।

  • वे बॉक्स के भीतर की किताबों के औसत (average) और फैलाव (spread) को देखते हैं।
  • वे एक सांख्यिकीय अनुमान (मौसम के पूर्वानुमान की तरह) का उपयोग करते हैं ताकि यह अनुमान लगाया जा सके कि उस बॉक्स में किसी किताब का उच्चतम संभव स्कोर क्या हो सकता है।
  • यदि "मौसम का पूर्वानुमान" कहता है कि उस बॉक्स की सबसे अच्छी किताब भी बहुत उबाऊ है, तो वे उस बॉक्स को छोड़ देते हैं। यह उन्हें अच्छे वाले को मिस किए बिना, अप्रासंगिक बॉक्स को छोड़ने के बारे में और भी आक्रामक होने की अनुमति देता है।

3. "सटीक" खोज (Support Recovery)

एक बार जब लाइब्रेरियन केवल आशाजनक बक्सों का चयन कर लेता है, तो वे उन्हें खोलते हैं और Entmax गणित चलाते हैं।

  • क्योंकि Entmax अप्रासंगिक वस्तुओं को शून्य देता है, इसलिए गणित स्वाभाविक रूप से चयनित बक्सों के भीतर के कचरे को अनदेखा कर देता है।
  • परिणाम: यदि लाइब्रेरियन ने सही बॉक्स चुने हैं, तो कहानी 100% सटीक होगी, ठीक वैसे ही जैसे उन्होंने पूरा पुस्तकालय पढ़ा होता। उन्होंने बस कचरे पर समय बर्बाद नहीं किया।

यह क्यों महत्वपूर्ण है (परिणाम)

पेपर ने पुराने "Softmax" तरीके के मुकाबले इसका परीक्षण किया और पाया:

  1. कम गलतियाँ: जब आप पुराने Softmax विधि का उपयोग करके किताबों को छोड़ने की कोशिश करते हैं, तो आप अनिवार्य रूप से कुछ महत्वपूर्ण "छोटे टिकटों" को फेंक देते हैं, जिससे त्रुटियां होती हैं। EntmaxKV, जब तक यह सही बॉक्स ढूंढ लेता है, तब तक शून्य महत्वपूर्ण जानकारी फेंकता है।
  2. गति: बहुत लंबी कहानियों (10 लाख शब्द) पर, EntmaxKV मानक विधि की तुलना में 3.36 गुना तेज़ था और एक मानक Entmax विधि (जिसमें यह स्किप करने वाली ट्रिक नहीं थी) की तुलना में 5.43 गुना तेज़ था।
  3. सटीकता: इसने मेमोरी ट्रैफिक के एक बहुत छोटे हिस्से का उपयोग करते हुए भी कहानी की गुणवत्ता (कम perplexity) को उच्च बनाए रखा।

सारांश उपमा (Summary Analogy)

  • पुराना तरीका (Softmax): आपके पास दस लाख ईमेल हैं। आपको यह तय करने के लिए कि किन पर जवाब देना है, हर एक के विषय (subject line) को पढ़ना होगा, क्योंकि स्पैम में भी महत्वपूर्ण होने की थोड़ी संभावना होती है।
  • EntmaxKV: आपके पास एक स्मार्ट फ़िल्टर है। यह पहले भेजने वाले और विषय मेटाडेटा को देखता है। यह तुरंत पहचान लेता है कि 99% ईमेल निश्चित रूप से स्पैम हैं (शून्य संभावना)। यह उन्हें बिना खोले ही डिलीट कर देता है। यह केवल उस 1% को खोलता है जो महत्वपूर्ण हो सकता है। क्योंकि फ़िल्टर सटीक है, आप कभी भी वास्तविक ईमेल मिस नहीं करते, लेकिन आप घंटों का समय बचा लेते हैं।

पेपर का मुख्य दावा: एक ऐसे गणितीय सिस्टम में स्विच करके जो अप्रासंगिक डेटा के लिए "सटीक शून्य" बनाता है, और मेटाडेटा की जाँच करके, हम सटीकता खोए बिना लंबे कार्यों पर AI को बहुत तेज़ बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →