← नवीनतम पेपर
🤖 AI

KVpop -- Key-Value Cache Compression with Predictive Online Pruning

KVpop एक सीखे हुए, भविष्य कहने वाले ऑनलाइन प्रूनिंग पॉलिसी को पेश करके ऑटोरेग्रेसिव डिकोडिंग में मेमोरी बॉटलनेक को संबोधित करता है जो उच्च संपीड़न दर प्राप्त करने के लिए एक नवीन फ्यूचर-अटेंशन टारगेट और डिलेड स्कोरिंग का उपयोग करता है और गणितीय तर्क कार्यों पर लगभग पूर्ण अटेंशन प्रदर्शन बनाए रखता है।

मूल लेखक: Lukas Hauzenberger, Niklas Schmidinger, Anamaria-Roberta Hartl, David Stap, Thomas Schmied, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lukas Hauzenberger, Niklas Schmidinger, Anamaria-Roberta Hartl, David Stap, Thomas Schmied, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी कहानी को याद रखने की कोशिश कर रहे हैं ताकि आप उसे एक बार में एक शब्द करके आगे लिख सकें। इसे कुशलतापूर्वक करने के लिए, आपका मस्तिष्क (या इस मामले में, एक कंप्यूटर एआई) आपके द्वारा पहले कहे गए सबसे महत्वपूर्ण शब्दों का एक "रफ नोट" या "स्क्रैचपैड" रखता है। इस स्क्रैचपैड को KV Cache कहा जाता है।

समस्या यह है कि जैसे-जैसे कहानी लंबी होती जाती है, यह स्क्रैचपैड बहुत बड़ा होता जाता है। अंततः, यह इतना बड़ा हो जाता है कि आपकी मेमोरी में फिट नहीं हो पाता, और कंप्यूटर धीमा होकर रेंगने लगता है क्योंकि उसे हर अगला शब्द बोलने के लिए उस डेटा को बार-बार इधर-उधर खोजना पड़ता है।

पुराना तरीका: "फेंक देने वाला" अनुमान
पिछले तरीकों ने यह अनुमान लगाने की कोशिश की कि किन शब्दों को फेंक दिया जाना चाहिए। कुछ तरीकों ने बस शुरुआती शब्दों को रखा और कुछ आखिरी शब्दों को। दूसरों ने देखा कि अभी किन शब्दों पर सबसे अधिक ध्यान दिया जा रहा है और उन शांत शब्दों को हटा दिया।

ये तरीके इस पेपर के अनुसार एक ऐसे लाइब्रेरियन की तरह हैं जो किताबों को आज उनकी धूल देखकर फेंक देता है, यह समझे बिना कि एक धूल भरी किताब भविष्य में किसी रहस्य को सुलझाने की कुंजी हो सकती है। वे अक्सर गलत चीजों को फेंक देते हैं, जिससे एआई भ्रमित या गलतियाँ करने लगता है।

नया समाधान: KVpop (वह लाइब्रेरियन जिसके पास "भविष्य-दृष्टि" है)
लेखक एक नया सिस्टम पेश करते हैं जिसे KVpop कहा जाता है। कल्पना कीजिए कि KVpop एक सुपर-स्मार्ट लाइब्रेरियन है जो न केवल अभी की किताब को देखता है, बल्कि उसके पास एक विशेष "भविष्य-दृष्टि" (future-sight) की क्षमता भी है।

यह कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से दिया गया है:

1. "संरक्षित विंडो" (वीआईपी सेक्शन)

KVpop हमेशा दो चीजों को सुरक्षित रखता है:

  • "सिंक" टोकन (The "Sink" Tokens): कहानी के शुरुआती कुछ शब्द (जैसे शीर्षक या शुरुआती वाक्य)।
  • "संरक्षित विंडो" (The "Protected Window"): वे सबसे हालिया शब्द जो आपने अभी-अभी कहे हैं।
    इन्हें कभी भी फेंका नहीं जाता। ये "वीआईपी" हैं जो पहली पंक्ति में रहते हैं।

2. "फ्यूचर-अटेंशन" टारगेट (क्रिस्टल बॉल)

असली जादू कहानी के बीच के पुराने शब्दों के साथ होता है।

  • पुराना तरीका: लाइब्रेरियन अनुमान लगाता है, "यह शब्द अभी उबाऊ लग रहा है, इसलिए मैं इसे फेंक दूँगा।"
  • KVpop का तरीका: लाइब्रेरियन पूछता है, "यदि मैं इस शब्द को रखता हूँ, तो क्या यह बाद में उपयोगी होगा जब कहानी किसी जटिल हिस्से तक पहुँचेगी?"

इस उत्तर को पाने के लिए, सिस्टम एक ट्रेनिंग ट्रिक का उपयोग करता है। यह भविष्य का अनुकरण (simulate) करता है। यह एक टोकन (एक शब्द) को देखता है और पूछता है, "यदि हम इस शब्द के 'प्रोटेक्टेड विंडो' से बाहर होने तक प्रतीक्षा करें, तो कहानी को वास्तव में इसकी कितनी आवश्यकता होगी?" यह इस आधार पर एक स्कोर की गणना करता है कि उसकी भविष्य की उपयोगिता (future utility) क्या है, न कि केवल वर्तमान लोकप्रियता।

3. "विलंबित निर्णय" (अधिक सुरागों का इंतज़ार करना)

यह दूसरा चतुर तरीका है।
कल्पना कीजिए कि आप तय करने जा रहे हैं कि अपने टूलबॉक्स में एक विशिष्ट उपकरण को रखना है या नहीं।

  • तत्काल निर्णय: आप उस उपकरण को उठाते ही उसे देखते हैं और तुरंत निर्णय लेते हैं।
  • KVpop का विलंबित निर्णय: आप उस उपकरण को एक "होल्डिंग ज़ोन" (प्रोटेक्टेड विंडो) में रखते हैं। आप कुछ कदम तक प्रतीक्षा करते हैं, यह देखते हुए कि कहानी कैसे आगे बढ़ती है। यदि कहानी उस उपकरण का उपयोग करने लगती है, तो आप उसे रखते हैं। यदि कहानी उसके बिना आगे बढ़ जाती है, तो आप अंततः उसे फेंक देने का निर्णय लेते हैं।

यह "प्रतीक्षा अवधि" सिस्टम को निकट-भविष्य के संदर्भ (near-future context) को देखने की अनुमति देती है। यह अंतिम निर्णय लेने से पहले अधिक साक्ष्य जुटाता है, जिससे यह सुनिश्चित होता है कि वह गलती से किसी महत्वपूर्ण चीज़ को केवल इसलिए नहीं हटा देता क्योंकि उसकी अभी आवश्यकता नहीं थी।

4. परिणाम: एक छोटा, स्मार्ट बॉक्स

"भविष्य-दृष्टि" और "विलंबित निर्णय" का उपयोग करके, KVpop (KV cache) को 75% से 88% तक सिकोड़ सकता है।

  • उपमा: कल्पना कीजिए कि आपके पास एक बैकपैक है जो केवल 10 चीजें रख सकता है। बिना सोचे-समझे कचरा भरने के बजाय, KVpop उसमें ठीक वही 10 चीजें भरता है जिनकी आपको अपनी बाकी की यात्रा के दौरान आवश्यकता होगी।
  • प्रदर्शन: पेपर दिखाता है कि इस छोटे से बैकपैक के साथ भी, एआई (विशेष रूप से Qwen3 मॉडल) लगभग उसी तरह प्रदर्शन करता है जैसे कि उसके पास पूरा, विशाल बैकपैक हो। यह मूल सटीकता के लगभग 100% के साथ जटिल गणितीय समस्याओं (जैसे AIME और HMMT) को हल करता है, जबकि बहुत कम मेमोरी का उपयोग करता है और तेज़ चलता है।

सारांश

KVpop एक ऐसे लाइब्रेरियन की तरह है जो अनुमान लगाना बंद कर देता है कि कौन सी किताबें फेंक देनी चाहिए। इसके बजाय, यह:

  1. शुरुआत और तत्काल वर्तमान को सुरक्षित रखता है।
  2. एक "क्रिस्टल बॉल" का उपयोग करता है यह अनुमान लगाने के लिए कि किन पुरानी किताबों की बाद में आवश्यकता होगी।
  3. अंतिम निर्णय लेने से पहले अधिक सुराग जुटाने के लिए थोड़ा इंतजार करता है।

परिणामस्वरूप, यह एक ऐसा सिस्टम है जो एक महान कहानी सुनाने की क्षमता खोए बिना एक विशाल पुस्तकालय को एक छोटे से बॉक्स में समाहित कर देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →