← नवीनतम पेपर
💻 computer science

CriticalKV: Optimizing KV Cache Eviction from an Output Perturbation Perspective

यह शोधपत्र CriticalKV को प्रस्तुत करता है, जो एक औपचारिक रूप से आधारित, प्लग-एंड-प्ले एल्गोरिदम है जो आउटपुट परटर्बेशन (output perturbation) का विश्लेषण करके महत्वपूर्ण प्रविष्टियों की पहचान करने द्वारा KV कैश इविक्शन (eviction) को अनुकूलित करता है, जिससे विभिन्न लॉन्ग-कॉन्टेक्स्ट बेंचमार्क में नगण्य कम्प्यूटेशनल ओवरहेड के साथ संपीड़न हानि (compression loss) को काफी कम किया जा सकता है।

मूल लेखक: Yuan Feng, Junlin Lv, Haoyu Guo, Yukun Cao, S Kevin Zhou, Xike Xie

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuan Feng, Junlin Lv, Haoyu Guo, Yukun Cao, S Kevin Zhou, Xike Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "ज़रूरत से ज़्यादा भरा हुआ सूटकेस"

कल्पना कीजिए कि आप एक लार्ज लैंग्वेज मॉडल (LLM) हैं जो कोई कहानी लिखने या किसी प्रश्न का उत्तर देने की कोशिश कर रहे हैं। ऐसा करने के लिए, आपको वह सब कुछ याद रखने की ज़रूरत है जो आपने अब तक पढ़ा है। AI की दुनिया में, इस मेमोरी को KV Cache (की-वैल्यू कैश) कहा जाता है।

KV Cache को अपने साथ ले जाने वाले एक विशाल, ज़रूरत से ज़्यादा भरे हुए सूटकेस के रूप में सोचें। हर बार जब आप एक नया शब्द पढ़ते हैं, तो आप सूटकेस में एक नई चीज़ जोड़ते हैं।

  • समस्या: जैसे-जैसे कहानी लंबी होती जाती है, सूटकेस विशाल होता जाता है। इसे ले जाना बहुत भारी हो जाता है (उच्च मेमोरी लागत) और जो चीज़ आपको चाहिए उसे ढूँढने के लिए उसमें हाथ मारना बहुत समय लेने वाला हो जाता है (धीमी गति)।
  • मौजूदा समाधान: सूटकेस को हल्का बनाने के लिए, पिछले तरीकों ने चीज़ों को फेंकने की कोशिश की। उन्होंने एक सरल नियम का उपयोग किया: "यदि किसी चीज़ को हाल ही में बहुत कम देखा गया है, तो उसे बाहर निकाल दें।" उन्होंने प्रत्येक चीज़ के लिए एक "लोकप्रियता स्कोर" (जिसे attention weights कहा जाता है) देखा। यदि स्कोर कम था, तो उस चीज़ को फेंक दिया जाता था।

खामी: "लोकप्रियता" का जाल

इस पेपर के लेखक तर्क देते हैं कि "लोकप्रियता स्कोर" पूरी कहानी नहीं है। यह एक किताब को इस आधार पर आंकने जैसा है कि उसे कितनी बार खोला गया, जबकि यह नज़रअंदाज़ कर दिया गया कि उस किताब के अंदर क्या है

कभी-कभी, किसी चीज़ को अक्सर नहीं देखा जाता है (कम लोकप्रियता), लेकिन उसमें जानकारी का एक महत्वपूर्ण हिस्सा (जैसे कोई विशिष्ट संख्या या नाम) होता है जो अंतिम उत्तर के लिए अत्यंत महत्वपूर्ण है। यदि आप इसे केवल इसलिए फेंक देते हैं क्योंकि यह "लोकप्रिय" नहीं था, तो आपकी कहानी बिखर जाएगी।

समाधान: CriticalKV

यह पेपर चीज़ों को रखने और फेंकने का निर्णय लेने का एक नया तरीका पेश करता है। वे इसे CriticalKV कहते हैं।

केवल "लोकप्रियता स्कोर" देखने के बजाय, वे संभावित नुकसान (जिसे output perturbation कहा जाता है) को देखते हैं जो किसी चीज़ को हटाने से होगा।

उपमा: "डगमगाता हुआ टॉवर"

कल्पना कीजिए कि आपकी मेमोरी ब्लॉक्स (blocks) का एक टॉवर है।

  • पुराना तरीका: आप उन ब्लॉक्स को बाहर निकाल देते हैं जिन्हें कम छुआ जाता है। आप मान लेते हैं कि टॉवर खड़ा रहेगा क्योंकि उन ब्लॉक्स ने बहुत अधिक भार नहीं उठाया था।
  • CriticalKV तरीका: आप पूछते हैं, "यदि मैं इस ब्लॉक को बाहर निकाल दूँ, तो टॉवर कितना डगमगाएगा?"
    • कुछ ब्लॉक्स शायद कम छुए जाते हैं, लेकिन यदि आप उन्हें निकालते हैं, तो पूरा टॉवर ढह जाएगा। ये Critical (महत्वपूर्ण) हैं।
    • कुछ ब्लॉक्स को अक्सर छुआ जाता है, लेकिन यदि आप उन्हें निकालते हैं, तो टॉवर मुश्किल से हिलता है। ये Non-Critical (गैर-महत्वपूर्ण) हैं।

नया तरीका ठीक से गणना करता है कि किसी विशिष्ट मेमोरी एंट्री को हटाने से AI का आउटपुट (टॉवर) कितना "डगमगाएगा"। यह उन ब्लॉक्स को रखने की कोशिश करता है जिनसे सबसे कम डगमगाहट होगी।

यह कैसे काम करता है (दो-चरणीय रणनीति)

पेपर सबसे अच्छे ब्लॉक्स को चुनने के लिए एक स्मार्ट, दो-चरणीय एल्गोरिदम का प्रस्ताव देता है:

  1. चरण 1: "प्रसिद्ध" ब्लॉक्स। सबसे पहले, यह उच्चतम "लोकप्रियता स्कोर" (attention weights) वाली चीज़ों को चुनता है। यह सुनिश्चित करता है कि यह स्पष्ट और अत्यधिक उपयोग की जाने वाली जानकारी को सुरक्षित रखे।
  2. चरण 2: "छिपे हुए रत्न" (Hidden Gems)। यह जादुई हिस्सा है। शेष सूटकेस के स्थानों के लिए, यह केवल लोकप्रियता नहीं देखता। यह वस्तु की सामग्री (content) और AI का आंतरिक "अनुवादक" (पैरामीटर मैट्रिक्स) उसे कैसे संभालता है, इस पर ध्यान देता है। यह पूछता है, "भले ही यह लोकप्रिय न हो, क्या इसमें एक अनूठी आकृति है जिसे हटाने से टॉवर टूट जाएगा?" यह उन चीज़ों को रखता है जो डगमगाहट को न्यूनतम करती हैं।

परिणाम: एक हल्का सूटकेस, वही गुणवत्ता

शोधकर्ताओं ने तीन अलग-अलग AI मॉडलों (Llama, Mistral, और Qwen) पर 29 विभिन्न डेटासेट्स (जैसे लंबे दस्तावेज़ों के बारे में उत्तर देना या घास के ढेर में छिपी सुई खोजना) का उपयोग करके इस नए तरीके का परीक्षण किया।

  • दावा: जब उन्होंने इस नए "डगमगाहट-जांचने" वाले नियम को मौजूदा तरीकों में जोड़ा, तो AI ने पुराने तरीकों की तुलना में आधे से भी कम गलतियाँ कीं।
  • दक्षता: इसने AI को महत्वपूर्ण रूप से धीमा नहीं किया। यह एक स्मार्ट पैकिंग लिस्ट रखने जैसा है जिसे लिखने में उतना ही समय लगता है लेकिन यह आपको अनावश्यक कचरा ढोने से बचा लेता है।

सारांश

संक्षेप में, CriticalKF कहता है: "सिर्फ उन चीज़ों को मत फेंको जो लोकप्रिय नहीं हैं। जाँचो कि क्या उन्हें फेंकने से अंतिम उत्तर टूट जाएगा।" ऐसा करके, वे लंबी और जटिल कहानियों को समझने की क्षमता खोए बिना AI के मेमोरी उपयोग को कम कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →