← नवीनतम पेपर
💬 NLP

KVzap: Fast, Adaptive, and Faithful KV Cache Pruning

KVzap एक तेज़, इनपुट-अनुकूल KV कैश प्रूनिंग विधि है जो विभिन्न लार्ज लैंग्वेज मॉडल्स और कार्यों में नगण्य सटीकता हानि के साथ अत्याधुनिक संपीड़न (compression) प्राप्त करती है, जो बढ़ते संदर्भ लंबाई (context lengths) के कारण उत्पन्न होने वाली महत्वपूर्ण इन्फरेंस बाधा को संबोधित करती है।

मूल लेखक: Simon Jegou, Maximilian Jeblick

प्रकाशित 2026-02-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Simon Jegou, Maximilian Jeblick

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी किताब पढ़ रहे हैं, और हर बार जब आप पन्ना पलटते हैं, तो कहानी को समझने के लिए आपको अब तक पढ़े गए हर एक शब्द को मानसिक रूप से याद रखना पड़ता है। जैसे-जैसे किताब लंबी होती जाती है, आपका मस्तिष्क (या इस मामले में कंप्यूटर की मेमोरी) उन सभी शब्दों को थामे रखने की कोशिश में अभिभूत होने लगता है। यह आधुनिक AI मॉडलों के साथ होने वाली समस्या है: जैसे-जैसे वे लंबे टेक्स्ट पढ़ते हैं, वे महत्वपूर्ण हिस्सों को याद रखने के लिए उपलब्ध "मानसिक स्थान" (मेमोरी) खो देते हैं।

यह पेपर KVzap नामक एक नए टूल का परिचय देता है जो इन AI मॉडलों के लिए एक अत्यंत कुशल पुस्तकालयाध्यक्ष (लाइब्रेरियन) की तरह कार्य करता है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

समस्या: "मानसिक अव्यवस्था" (The Mental Clutter)

जब एक AI एक वाक्य पढ़ता है, तो वह प्रत्येक शब्द के लिए एक "की-वैल्यू" (Key-Value या KV) जोड़ी बनाता है। इन्हें ऐसे समझें जैसे कि शब्द लिखे हुए स्टिकी नोट्स (sticky notes) हैं, जिन्हें नोटों के एक विशाल ढेर में रखा गया है।

  • बाधा (The Bottleneck): यदि AI 1,00,000 शब्दों का दस्तावेज़ पढ़ता है, तो उसके पास 1,0,0,000 स्टिकी नोट्स होंगे। उन सभी को रखने में बहुत अधिक मेमोरी लगती है, जिससे AI धीमा हो जाता है और इसे चलाना महंगा हो जाता है।
  • पुराना तरीका: पिछले तरीकों ने सरल नियमों के आधार पर स्टिकी नोट्स को फेंकने की कोशिश की (जैसे "केवल अंतिम 100 शब्दों को रखें" या "उन शब्दों को रखें जो सबसे अधिक बार आए")। लेकिन ये नियम अक्सर बहुत ही साधारण होते थे, जिससे अनजाने में महत्वपूर्ण जानकारी भी फेंक दी जाती थी और AI गलतियाँ करने लगता था।

समाधान: KVzap (स्मार्ट लाइब्रेरियन)

KVzap यह तय करता है कि किन स्टिकी नोट्स को रखना है और किन्हें फेंक देना है, लेकिन यह काम वह तेजी से, समझदारी से और सत्यनिष्ठा से (बिना कहानी खोए) करता है।

यहाँ KVzap के काम करने के तरीके का रूपक (analogy) दिया गया है:

1. "दोबारा जाँचने" की समस्या (The Old Method)
एक पिछला शीर्ष-स्तरीय तरीका जिसे KVzip कहा जाता था, बहुत सटीक था। यह इस प्रकार काम करता था: यह तय करने के लिए कि क्या कोई शब्द महत्वपूर्ण है, AI पूरी किताब को फिर से पढ़ने का नाटक करता था और देखता था कि उसने किन शब्दों पर ध्यान दिया।

  • दोष: यह एक छात्र को एक अध्याय पढ़ने के लिए कहने जैसा है, फिर यह तय करने के लिए कि कौन से वाक्य महत्वपूर्ण थे, उसे वही अध्याय दोबारा पढ़ने के लिए कहना। यह बहुत धीमा है और इसमें बहुत अधिक ऊर्जा लगती है। साथ ही, यह AI द्वारा कहानी लिखते समय (डिकोडिंग के दौरान) काम नहीं कर सकता था, केवल पढ़ते समय ही काम कर सकता था।

2. KVzap का शॉर्टकट
KVzap इसे एक छोटे, अत्यंत तेज़ "सहायक" (एक छोटा न्यूरल नेटवर्क) को प्रशिक्षित करके हल करता है, जो बिना टेक्स्ट को दोबारा पढ़े यह अनुमान लगा लेता है कि कौन से शब्द महत्वपूर्ण हैं।

  • रूपक: कल्पना कीजिए कि एक अनुभवी लाइब्रेरियन है जिसने हजारों किताबें पढ़ी हैं। एक नया किताब पढ़ने के बाद यह पता लगाने के लिए कि महत्वपूर्ण हिस्से कौन से हैं, उसे दोबारा पढ़ने की आवश्यकता नहीं है; वह बस पन्ने पर एक नज़र डालता है और तुरंत जान जाता है, "यह पैराग्राफ महत्वपूर्ण है, इसे रखें। वह सिर्फ फालतू है, इसे फेंक दें।"
  • यह कैसे सीखता है: टीम ने इस "सहायक" को AI के आंतरिक विचारों (हिडन स्टेट्स) को दिखाकर और उससे यह अनुमान लगाने को कहकर प्रशिक्षित किया कि धीमे, 'डबल-चेक' वाले तरीके ने क्या कहा होता। सहायक ने विशेषज्ञ की नकल करना पूरी तरह से सीख लिया, लेकिन एक सेकंड के बहुत छोटे हिस्से में।

3. "स्लाइडिंग विंडो" सुरक्षा जाल (The Sliding Window Safety Net)
यह सुनिश्चित करने के लिए कि AI तत्काल संदर्भ (जैसे कि उसने अभी जो पिछले कुछ वाक्य लिखे हैं) को न भूल जाए, KVzap हाल के 128 शब्दों की एक "स्लाइडिंग विंडो" रखता है।

  • रूपक: भले ही आप एक पूरे उपन्यास का सारांश तैयार कर रहे हों, आप हमेशा अंतिम कुछ पन्ने अपने हाथ में रखते हैं ताकि आप अपना स्थान न खो दें। KVzap इन हालिया शब्दों को सुरक्षित रखता है और उन्हें कभी नहीं फेंकता।

यह एक बड़ी बात क्यों है?

पेपर का दावा है कि KVzap तीन मुख्य कारणों से एक गेम-चेंजर है:

  • यह तेज़ है: यह प्रक्रिया में लगभग कोई अतिरिक्त समय नहीं जोड़ता है। यह एक ऐसे लाइब्रेरियन की तरह है जो आपके लाइब्रेरी में प्रवेश करते समय ही किताबों को छाँट रहा होता है।
  • यह अनुकूलन योग्य है: यह किसी निश्चित नियम (जैसे "50% नोट्स रखें") का उपयोग नहीं करता है। इसके बजाय, यह टेक्स्ट को देखता है। यदि टेक्स्ट जटिल और सघन है, तो यह अधिक नोट्स रखता है। यदि टेक्स्ट दोहराव वाला है, तो यह अधिक नोट्स फेंक देता है। यह स्वतः ही समायोजित हो जाता है।
  • यह सटीक है: लंबे रीडिंग कार्यों (जैसे 4,000 शब्दों के दस्तावेज़ से प्रश्न पूछना) और रीजनिंग कार्यों (जैसे गणित की समस्याओं को हल करना) पर परीक्षणों में, KVzap ने मेमोरी के उपयोग को 2 से 4 गुना तक कम कर दिया, जबकि AI की सटीकता को लगभग वैसा ही बनाए रखा जैसा कि तब होता यदि उसने सभी नोट्स रखे होते।

परिणाम

शोधकर्ताओं ने लोकप्रिय AI मॉडलों (जैसे Qwen और Llama) पर इसका परीक्षण किया। उन्होंने पाया कि:

  • KVzap ने 15 मौजूदा तरीकों को पछाड़ दिया।
  • इसने लंबे-संदर्भ (long-context) वाले कार्यों के लिए एक लीडरबोर्ड पर सर्वश्रेष्ठ स्कोर प्राप्त किया।
  • यह लंबे दस्तावेज़ पढ़ने (प्रीफिलिंग) और लंबी कहानियाँ लिखने या स्टेप-बाय-स्टेप समस्याएँ हल करने (डिकोडिंग) दोनों के लिए काम करता है।

सारांश में

KVzap एक AI को एक "स्मार्ट फिल्टर" देने जैसा है जो तुरंत जानता है कि एक लंबी बातचीत या दस्तावेज़ के कौन से हिस्से आवश्यक हैं और कौन से केवल शोर (noise) हैं। यह AI को बहुत लंबे टेक्स्ट को संभालने की अनुमति देता है बिना मेमोरी खत्म हुए या भ्रमित हुए, और यह सब बिना प्रक्रिया को धीमा किए। लेखकों का मानना है कि यह इसे प्रमुख AI सिस्टमों में वास्तविक दुनिया के उपयोग के लिए तैयार बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →