← नवीनतम पेपर
🤖 machine learning

CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM

CONF-KV एक नवीन KV कैश इविक्शन रणनीति है जो मॉडल के प्रति-चरण भविष्यवाणी आत्मविश्वास के आधार पर गतिशील रूप से कैश बजट को समायोजित करती है और लंबी अवधि के LLM इन्फरेंस के लिए उच्च रिट्रीवल सटीकता और कार्य प्रदर्शन बनाए रखते हुए मेमोरी उपयोग को महत्वपूर्ण रूप से कम करने के लिए मिश्रित-परिशुद्धता स्टोरेज का उपयोग करती है।

मूल लेखक: Yubo Li, Yidi Miao

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yubo Li, Yidi Miao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी किताब पढ़ने की कोशिश कर रहे हैं, लेकिन आपका मस्तिष्क (कंप्यूटर की मेमोरी) एक बार में केवल कुछ ही पन्ने रख सकता है। जैसे-जैसे आप पढ़ते हैं, आपको वर्तमान वाक्य को समझने के लिए यह याद रखने की आवश्यकता होती है कि पहले क्या हुआ था। यदि आप बहुत अधिक भूल जाते हैं, तो आप भ्रमित हो जाते हैं। यदि आप सब कुछ याद रखने की कोशिश करते हैं, तो आपका मस्तिष्क इतना भर जाता है कि वह बहुत धीमा हो जाता है।

यह ठीक वही समस्या है जिसे CONF-KV लंबी कहानियाँ लिखते या लंबी बातचीत करते समय AI मॉडल्स (लार्ज लैंग्वेज मॉडल्स) के लिए हल करता है।

यहाँ बताया गया है कि यह पेपर इसे सरल उपमाओं का उपयोग करके कैसे समझाता है:

समस्या: "ओवरफिल्ड बैकपैक" (ज़रूरत से ज़्यादा भरा हुआ बस्ता)

जब एक AI टेक्स्ट जेनरेट करता है, तो वह जानकारी का एक "बैकपैक" रखता है जिसे KV Cache कहा जाता है। यह बैकपैक उस पूरे संदर्भ (context) को थामे रहता है जो AI ने अब तक कहा है।

  • समस्या: जैसे-जैसे बातचीत लंबी होती जाती है, बैकपैक भारी होता जाता है। अंततः, यह इतना भारी हो जाता है कि AI की मेमोरी खत्म हो जाती है (बैकपैक फट जाता है) या यह इतना धीमा हो जाता है कि सोचने में बहुत समय लगता है।
  • पुराना तरीका: अधिकांश AI सिस्टम एक "स्लाइडिंग विंडो" (Sliding Window) का उपयोग करते हैं। एक ट्रेन की खिड़की की कल्पना करें। जैसे-जैसे ट्रेन आगे बढ़ती है, बाहर का दृश्य बदलता जाता है। AI केवल पिछले 512 शब्दों (खिड़की के ठीक बाहर का दृश्य) को याद रखता है और उससे पहले की सब कुछ भूल जाता है।
    • दोष: यदि किसी प्रश्न का उत्तर 1,000 शब्द पहले दिया गया था, तो स्लाइडिंग विंडो उसे पूरी तरह से भूल जाती है, और AI विफल हो जाता है।
  • दूसरा पुराना तरीका: कुछ सिस्टम इस आधार पर "महत्वपूर्ण" शब्दों को याद रखने की कोशिश करते हैं कि अतीत में उन्हें कितनी बार देखा गया था। लेकिन यह इस बात को देखने जैसा है कि आप कल कहाँ थे, न कि यह कि आप अभी कैसा महसूस कर रहे हैं

समाधान: "कॉन्फिडेंस मीटर" (आत्मविश्वास का पैमाना)

इस पेपर के लेखकों ने, CONF-KV, बैकपैक को प्रबंधित करने का एक नया तरीका पेश किया है। एक निश्चित नियम का उपयोग करने के बजाय, वे AI को एक कॉन्फिडेंस मीटर देते हैं।

AI को एक परीक्षा देने वाले छात्र के रूप में सोचें:

  1. जब छात्र आत्मविश्वासी होता है: उसे उत्तर आसानी से पता होता है। उसे अपने नोट्स देखने की आवश्यकता नहीं होती। इसलिए, सिस्टम कहता है, "बहुत अच्छा! आप सुनिश्चित हैं। चलिए जगह बचाने के लिए कुछ पुराने नोट्स फेंक देते हैं।"
  2. जब छात्र भ्रमित होता है: छात्र हिचकिचा रहा है। उसे यह समझने के लिए अपने इतिहास को देखने की आवश्यकता है। सिस्टम कहता है, "रुको, आप अनिश्चित लग रहे हैं। सभी नोट्स रखें! अभी कुछ भी मत फेंको।"

व्यवहार में यह कैसे काम करता है:

  • संकेत (The Signal): अगला शब्द चुनने से पहले, AI देखता है कि वह कितना निश्चित है। यदि अगला शब्द स्पष्ट है (उच्च आत्मविश्वास), तो वह अपनी मेमोरी को छोटा कर देता है। यदि अगला शब्द कठिन है (कम आत्मविश्वास), तो वह अपनी मेमोरी को बढ़ाता है।
  • छंटनी (The Sorting): भले ही इसे छोटा करने की आवश्यकता हो, यह केवल रैंडम चीज़ों को नहीं हटाता। यह सबसे हालिया शब्दों को रखता है (क्योंकि वे आमतौर पर महत्वपूर्ण होते हैं) और उन शब्दों को रखता है जिन्हें AI ने अतीत में सबसे अधिक बार देखा है। यह उस "बोरिंग" पुराने सामान को हटा देता है जिसकी किसी को परवाह नहीं है।

"मिक्सड-प्रिसिजन" (Mixed-Precision) का कमाल

पेपर एक और चतुर स्टोरेज ट्रिक का भी उल्लेख करता है।

  • कल्पना कीजिए कि आपके नोट्स कागज पर लिखे गए हैं।
  • हालिया नोट्स उच्च-गुणवत्ता वाले, मोटे कागज (FP16) पर लिखे गए हैं ताकि वे बिल्कुल स्पष्ट हों।
  • पुराने नोट्स पतले, रीसाइक्ल्ड कागज (INT8) पर लिखे गए हैं। वे बहुत कम जगह लेते हैं, लेकिन आप उनसे सार (gist) समझने के लिए पर्याप्त पढ़ सकते हैं।
  • यह AI को उसी बैकपैक स्पेस में बहुत अधिक इतिहास रखने की अनुमति देता है बिना गुणवत्ता खोए।

परिणाम क्या दिखाते हैं

लेखकों ने चार अलग-अलग AI मॉडल्स पर इसका परीक्षण किया और पाया:

  1. मेमोरी बचत: यह एक साधारण "स्लाइडिंग विंडो" (सब कुछ पुराना भूल जाना) के समान मात्रा में मेमोरी का उपयोग करता है, लेकिन यह कहीं अधिक महत्वपूर्ण विवरण याद रखता है।
  2. बेहतर सटीकता: एक "नीडल इन अ हेस्टैक" (एक विशाल टेक्स्ट में छिपी एक विशिष्ट तथ्य को खोजना) टेस्ट में, CONF-KV ने 91.4% बार सुई को खोज निकाला। पुराने स्लाइडिंग विंडो ने इसे केवल 53.8% बार खोजा।
  3. वास्तविक दुनिया के कार्य: जब इसे एक वेब-ब्राउज़िंग एजेंट के रूप में उपयोग किया गया (ऑनलाइन चीजें खरीदने या फॉर्म भरने की कोशिश करना), तो यह फुल-मेमोरी वर्जन की तरह ही 95.3% बार सफल रहा, लेकिन इसने 2.8 गुना कम मेमोरी का उपयोग किया।
  4. गति: क्योंकि बैकपैक हल्का है, AI तेजी से सोचता है (कम लेटेंसी) और एक साथ अधिक उपयोगकर्ताओं को संभाल सकता है (उच्च थ्रूपुट)।

निष्कर्ष

CONF-KV एक स्मार्ट लाइब्रेरियन की तरह है जो केवल इसलिए किताबें नहीं फेंकता क्योंकि वे "पुरानी" हैं। इसके बजाय, लाइब्रेरियन पाठक को देखता है। यदि पाठक संघर्ष कर रहा है, तो लाइब्रेरियन पूरी लाइब्रेरी खुली रखता है। यदि पाठक आसानी से आगे बढ़ रहा है, तो लाइब्रेरियन कमरे को तेज़ बनाने के लिए अव्यवस्था को साफ कर देता है।

यह AI को बिना मेमोरी खत्म हुए या धीमे हुए लंबी और स्मार्ट बातचीत करने की अनुमति देता है, केवल यह सुनकर कि हर एक कदम पर AI कितना "निश्चित" महसूस कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →