← नवीनतम पेपर
🤖 machine learning

Every Cache Entry Earns Its Place: Global Allocation of Resolution and Coverage for KV Cache Compression

यह शोध पत्र GraceKV का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free), GPU-नेटिव विधि है जो KV कैश संपीड़न को सभी परतों और हेड्स के बीच सूचना कवरेज और स्थानीय रिज़ॉल्यूशन को गतिशील रूप से संतुलित करने के लिए एक वैश्विक संसाधन आवंटन समस्या के रूप में तैयार करती है, जिससे लंबी-संदर्भ (long-context) वाली कार्यों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Haolin Tian, Yuzhe Liu, Tonghan Wang

प्रकाशित 2026-08-10
📖 10 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haolin Tian, Yuzhe Liu, Tonghan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, 1,00,000 पन्नों के उपन्यास को याद करने की कोशिश कर रहे हैं ताकि पेज नंबर 42,000 पर उल्लेखित किसी पात्र के बारे में एक एकल प्रश्न का उत्तर दिया जा सके। आपका मस्तिष्क एक सुपरकंप्यूटर है, लेकिन आपके पास एक बहुत छोटी, महंगी डेस्क है जहाँ आप एक बार में केवल कुछ ही पन्ने खुले रख सकते हैं। हर बार जब आप अगला वाक्य पढ़ने के लिए पन्ना पलटते हैं, तो आपको अपनी डेस्क को व्यवस्थित करना पड़ता है, नए पन्नों के लिए जगह बनाने के लिए पुराने पन्नों को फर्श पर फेंकना पड़ता है। यह बिल्कुल वैसा ही है जैसे आधुनिक "लार्ज लैंग्वेज मॉडल्स" (LLMs) लंबी कहानियों या दस्तावेजों को पढ़ते समय काम करते हैं। वे जो कुछ भी पढ़ चुके हैं उसका एक "की-वैल्यू कैश" (एक फैंसी मेमोरी डेस्क) रखते हैं ताकि उसे दोबारा कैलकुलेट न करना पड़े। लेकिन जैसे-जैसे कहानी लंबी होती जाती है, यह डेस्क बहुत भीड़भाड़ वाली हो जाती है, जिससे कंप्यूटर धीमा हो जाता है और इसकी मेमोरी भर जाती है। वैज्ञानिक इसे हल करने के लिए या तो "कम महत्वपूर्ण" पन्नों को फेंक देते हैं (टोकन इवििक्शन) या समान पन्नों को एक एकल सारांश शीट में चिपका देते हैं (KV मर्जिंग)। हालांकि, ये पुराने तरीके कठोर नियमों की तरह हैं: वे पहले से ही तय कर देते हैं कि किन पन्नों को रखना है या उन्हें कैसे चिपकाना है, बिना यह देखे कि आप जो विशिष्ट प्रश्न पूछ रहे हैं वह क्या है। वे कहानी के सबसे महत्वपूर्ण हिस्सों पर ध्यान केंद्रित करने के लिए संसाधनों को आसानी से इधर-उधर नहीं ले जा सकते जब कहानी बदल जाती है।

यह पेपर उस मेमोरी डेस्क को प्रबंधित करने का एक नया, स्मार्ट तरीका पेश करता है जिसे GraceKV कहा जाता है। एक कठोर नियम पुस्तिका का पालन करने के बजाय, GraceKV मेमोरी को एक लचीले बजट की तरह मानता है जिसे वहां खर्च किया जा सकता है जहां इसकी सबसे अधिक आवश्यकता है। कल्पना कीजिए कि आपके पास सीमित संख्या में "मेमोरी टोकन" (जैसे सिक्के) हैं जिनसे आप स्टोरेज स्पेस खरीद सकते हैं। पुराने तरीके शायद कहें, "हमें हर अध्याय का 10% रखना चाहिए," या "हमें हर 10 पन्नों को जोड़ना चाहिए।" हालाँकि, GraceKV पूछता है: "इस विशिष्ट प्रश्न के लिए सबसे मूल्यवान जानकारी कहाँ है?" यह प्रत्येक भाग के लिए एक विशेष पेड़ जैसी संरचना (tree-like map) बनाता है। पेड़ के शीर्ष पर, एक एकल "समरी कॉइन" (सारांश सिक्का) पाठ के एक बड़े हिस्से को कवर करता है (व्यापक कवरेज)। यदि कहानी किसी विशिष्ट स्थान पर दिलचस्प या भ्रमित करने वाली हो जाती है, तो GraceKV उस सारांश सिक्के को "विभाजित" (split) कर सकता है ताकि उस छोटे से हिस्से के लिए अधिक विस्तृत, उच्च-रिज़ॉल्यूशन वाले सिक्के खरीदे जा सकें (स्थानीय रिज़ॉल्यूशन)। यह पूरे कहानी के माध्यम से एक व्यापक सारांश रखने बनाम एक विस्तृत अंश रखने के मूल्य की तुलना लगातार करता है, स्तर-दर-स्तर, और अपने बजट को उस संयोजन पर खर्च करता है जो सबसे अच्छा उत्तर देता है। पेपर दिखाता है कि मेमोरी को स्वतंत्र रूप से वहां बहने देने से जहाँ इसकी सबसे अधिक आवश्यकता है, GraceKV 128 गुना तक मेमोरी को कंप्रेस कर सकता है और फिर भी सटीक उत्तर दे सकता है, जो अक्सर निश्चित नियमों का उपयोग करने वाले अन्य तरीकों से बेहतर होता है। यह एक ऐसे लाइब्रेरियन की तरह है जो केवल किताबों को रखने की सूची का पालन नहीं करता, बल्कि वास्तविक समय में पूरी लाइब्रेरी को पुनर्व्यवस्थित करता है ताकि यह सुनिश्चित हो सके कि जिस एक किताब की आपको आवश्यकता है वह आपके ठीक सामने है, भले ही इसके लिए बाकी सब कुछ हटाना पड़े।

समस्या: "याद रखने के लिए बहुत लंबा" दुविधा

लार्ज लैंग्वेज मॉडल्स प्रतिभाशाली छात्रों की तरह हैं जो लगभग कुछ भी पढ़ सकते हैं, लेकिन उनकी अल्पकालिक स्मृति (short-term memory) की समस्या है। जब वे एक प्रश्न का उत्तर देने के लिए एक लंबे दस्तावेज़ को पढ़ते हैं, तो उन्हें अब तक देखे गए हर शब्द के "की" (Key) और "वैल्यू" (Value) (कौन, क्या, कहाँ और क्यों) को याद रखने की आवश्यकता होती है। यह मेमोरी, जिसे KV कैश कहा जाता है, टेक्स्ट की लंबाई के साथ रैखिक रूप से बढ़ती है। यदि आप मॉडल को 1,00,000 शब्दों का उपन्यास देते हैं, तो उन कुंजियों और मानों को रखने के लिए आवश्यक मेमोरी बहुत बड़ी हो जाती है, जिससे कंप्यूटर की RAM भर जाती है और अगला शब्द जेनरेट करने की प्रक्रिया धीमी हो जाती है।

इसे ठीक करने के लिए, शोधकर्ताओं ने दो मुख्य तरकीबें आजमाई हैं:

  1. टोकन इवििक्शन (Token Eviction): "बोरिंग" शब्दों को फेंक देना और केवल "महत्वपूर्ण" शब्दों को रखना। यह एक किताब से उन पन्नों को हटाने जैसा है जो प्रासंगिक नहीं लगते।
  2. KV मर्जिंग (KV Merging): समान शब्दों को एक एकल "सारांश" प्रविष्टि में चिपका देना। यह कहानी के दस पन्नों को लेने और उन्हें एक पैराग्राफ से बदलने जैसा है जो उसका सार पकड़ लेता है।

इन पुराने तरीकों के साथ समस्या यह है कि वे कठोर हैं। वे आमतौर पर एक पूर्व-निर्धारित नियम का पालन करते हैं, जैसे "पिछले 100 शब्दों को रखें" या "हर 5 शब्दों को मर्ज करें।" वे आपके द्वारा पूछे गए विशिष्ट प्रश्न के अनुकूल नहीं होते हैं। कभी-कभी, एक शब्द जो बोरिंग लग सकता है वह उत्तर की कुंजी हो सकता है, और कभी-कभी, टेक्स्ट का एक बड़ा हिस्सा अप्रासंगिक हो सकता है। पुराने तरीके कवरेज (पूरी कहानी को याद रखना) और रिज़ॉल्यूशन (बारीक विवरणों को याद रखना) के बीच संतुलन बनाने में संघर्ष करते हैं क्योंकि वे अपने मेमोरी बजट को स्वतंत्र रूप से इधर-उधर नहीं ले जा सकते।

समाधान: GraceKV का "ग्लोबल बजट"

लेखक GraceKV का प्रस्ताव देते हैं, जो एक ऐसा सिस्टम है जो मेमोरी कंप्रेशन को नियम पालन करने वाले खेल के रूप में नहीं, बल्कि एक ग्लोबल रिसोर्स एलोकेशन समस्या के रूप में देखता है। इसे एक स्मार्ट सिटी प्लानर की तरह समझें जो बिजली के सीमित बजट का प्रबंधन कर रहा है। हर मोहल्ले को समान मात्रा में बिजली देने के बजाय, प्लानर देखता है कि अभी बिजली की आवश्यकता कहाँ है।

GraceKV तीन मुख्य चरणों में काम करता है:

  1. ट्री मैप बनाना:
    सबसे पहले, GraceKV लंबे विषय को "स्लॉट्स" (पाठ के टुकड़े) में तोड़ता है, जो केवल रैंडम कट नहीं बल्कि इस आधार पर होते हैं कि अर्थ कैसे बदल रहा है। AI के मस्तिष्क के प्रत्येक स्तर और प्रत्येक अटेंशन हेड के लिए, यह एक प्रोटोटाइप ट्री बनाता है।

    • पेड़ का मूल (root) पाठ के एक विशाल हिस्से का एक एकल, मोटा सारांश है।
    • शाखाएं (branches) उस हिस्से को छोटे, अधिक विस्तृत टुकड़ों में विभाजित कर सकती हैं।
    • पत्तियां (leaves) मूल, सटीक शब्द हैं।
      यह पेड़ सिस्टम को विस्तृत विवरण के विभिन्न स्तरों पर—एक व्यापक अवलोकन से लेकर एक सटीक शब्द तक—एक ही टेक्स्ट को प्रदर्शित करने की अनुमति देता है।
  2. वैल्यू फ्लो (खजाना खोजना):
    सिस्टम यह पता लगाता है कि वर्तमान प्रश्न के लिए टेक्स्ट का कौन सा हिस्सा वास्तव में उपयोगी है। यह केवल सीधे प्रश्न को नहीं देखता है; यह यह भी ट्रैक करता है कि सूचना टेक्स्ट के माध्यम से कैसे प्रवाहित होती है (जैसे एक जासूस सुरागों का पीछा करता है)। यदि कोई शब्द प्रश्न में उल्लेखित है, या यदि वह अन्य महत्वपूर्ण शब्दों से जुड़ता है, तो उसे एक उच्च "वैल्यू स्कोर" मिलता है। यह स्कोर सिस्टम को बताता है कि कहानी के उस हिस्से में कितना "खजाना" छिपा है।

  3. बजट फ्लो (सिक्कों को खर्च करना):
    अब जादू आता है। GraceKV के पास मेमोरी स्लॉट्स (सिक्कों) का एक निश्चित बजट है। यह पूरी कहानी में सभी संभावित कार्यों को देखता है:

    • ऐड (Add): एक नया, बिना कवर किए गए टेक्स्ट के टुकड़े को मोटे सारांश के साथ कवर करने के लिए एक सिक्का खर्च करना (कवरेज बढ़ाना)।
    • स्प्लिट (Split): एक मोटे सारांश को छोटे, अधिक विस्तृत टुकड़ों में तोड़ने के लिए एक सिक्का खर्च करना (रिज़ॉल्यूशन में सुधार करना)।

    प्रत्येक संभावित "ऐड" या "स्प्लिट" क्रिया एक एकल ग्लोबल क्यू (queue) में प्रतिस्पर्धा करती है। सिस्टम प्रत्येक क्रिया के लिए "यूटिलिटी" (प्रति सिक्का मूल्य) की गणना करता है। यदि एक छोटा, विशिष्ट शब्द उत्तर के लिए महत्वपूर्ण है, तो उस शब्द के सारांश को "स्प्लिट" करने की यूटिलिटी बहुत अधिक हो सकती है। यदि एक पूरा पैराग्राफ बोरिंग है, तो उसके लिए एक मोटा सारांश "ऐड" करना सिक्के का सबसे अच्छा उपयोग हो सकता है। सिस्टम उच्चतम-मूल्य वाली क्रियाओं को तब तक चुनता है जब तक कि बजट समाप्त न हो जाए।

    एक सुरक्षा जाल भी है जिसे सिंगलटन फ्लोर (Singleton Floor) कहा जाता है। कभी-कभी, एक ग्रीडी एल्गोरिदम किसी बहुत महत्वपूर्ण शब्द को मिस कर सकता है क्योंकि एक-एक करके वहां तक पहुँचने के कदम बहुत महंगे हो सकते हैं। GraceKV कुछ बजट अलग रखता है ताकि यह गारंटी दी जा सके कि कुछ उच्च-मूल्य वाले शब्दों को उनके मूल रूप में रखा जाए, जिससे यह सुनिश्चित हो सके कि कोई महत्वपूर्ण विवरण खो न जाए।

उन्होंने क्या पाया

लेखकों ने विभिन्न कार्यों पर GraceKV का परीक्षण किया, जिसमें लंबे दस्तावेजों से प्रश्न पूछना, कहानियों का सारांश बनाना और विशाल डेटासेट से विशिष्ट तथ्यों को प्राप्त करना शामिल है। उन्होंने इसे विभिन्न कंप्रेशन स्तरों (4x से 128x तक) पर मौजूदा सर्वोत्तम तरीकों (जैसे H2O, SnapKV, और PyramidKV) के विरुद्ध परखा।

  • प्रदर्शन: GraceKV 32 में से 24 अलग-अलग सेटिंग्स में शीर्ष पर रहा। यह लगातार पहले या दूसरे स्थान पर रहा, यहाँ तक कि जब मेमोरी बजट (128x कंप्रेशन) बहुत कम था।
  • मजबूती (Robustness): अन्य तरीकों के विपरीत जो एक प्रकार के कार्य के लिए बहुत अच्छे हो सकते हैं लेकिन दूसरे में विफल हो जाते हैं, GraceKV सभी कार्यों में मजबूत बना रहा। इसने "ब्रॉड कवरेज" वाले कार्यों (जैसे सारांश) और "प्रिसाइज रिट्रीवल" वाले कार्यों (जैसे एक विशिष्ट नाम ढूंढना) दोनों को समान रूप से संभाला।
  • दक्षता: मेमोरी को कंप्रेस करके, GraceKV ने आवश्यक मेमोरी को काफी कम कर दिया (पूर्ण मेमोरी से 92% तक कम) और टेक्स्ट जेनरेट करने के दौरान कंप्यूटर को तेज़ बना दिया, विशेष रूप से बहुत लंबे संदर्भों के लिए।
  • कोई ट्रेनिंग की आवश्यकता नहीं: सबसे शानदार बात यह है कि GraceKV को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यह प्रक्रिया के दौरान टेक्स्ट और प्रश्न का विश्लेषण करके काम करता है, जो इसे किसी भी मौजूदा मॉडल के लिए एक प्लग-एंड-प्ले समाधान बनाता है।

यह क्यों महत्वपूर्ण है

पेपर सुझाव देता है कि लंबे संदर्भ (long-context) वाले AI का भविष्य यह खोजने के बारे में नहीं है कि क्या रखना है या क्या फेंकना है, इसके लिए एक एकल "परफेक्ट" नियम क्या है। इसके बजाय, यह लचीलेपन के बारे में है। मेमोरी को एक साझा, ग्लोबल रिसोर्स के रूप में मानकर, जिसे व्यापक कवरेज और सूक्ष्म विवरण के बीच संतुलन बनाने के लिए गतिशील रूप से आवंटित किया जा सकता है, हम AI मॉडल्स को जटिल, लंबी कहानियों को समझने की क्षमता खोए बिना बहुत अधिक कुशल बना सकते हैं। GraceKV साबित करता है कि मेमोरी प्रबंधन के लिए एक स्मार्ट, एडेप्टिव दृष्टिकोण कठोर, पूर्व-निर्धारित नियमों की तुलना में बेहतर प्रदर्शन कर सकता है, जो ऐसी AI के लिए मार्ग प्रशस्त करता है जो अभिभूत हुए बिना पूरी लाइब्रेरी पढ़ सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →