← नवीनतम पेपर
🤖 machine learning

A Simple Plug-in for Improving Eviction-Based KV Cache Compression

यह शोध पत्र VECTOR को प्रस्तुत करता है, जो इविक्शन-आधारित (eviction-based) KV कैश संपीड़न के लिए एक प्लग-इन है, जो पुनर्गठित करने योग्य वैल्यू जानकारी को पुनः प्राप्त करने और गुणवत्ता-मेमोरी ट्रेड-ऑफ में सुधार करने के लिए एक तीन-तरफा टोकन रूटिंग रणनीति (रिटेंशन, एप्रोक्सिमेशन और इविक्शन) को लागू करके लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस को बढ़ाता है।

मूल लेखक: Yuping Lin, Jiayuan Ding, Yue Xing, Pengfei He, Jiliang Tang, Subhabrata Mukherjee

प्रकाशित 2026-05-25
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yuping Lin, Jiayuan Ding, Yue Xing, Pengfei He, Jiliang Tang, Subhabrata Mukherjee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक विशाल लेकिन भूलने वाले लाइब्रेरियन की कल्पना करें जो एक बहुत बड़ी, अंतहीन किताब के आधार पर किसी प्रश्न का उत्तर देने की कोशिश कर रहा है। अपना काम करने के लिए, लाइब्रेरियन अब तक पढ़ी गई किताब के सबसे महत्वपूर्ण हिस्सों के लिए एक "स्क्रैचपैड" (जिसे KV Cache कहा जाता है) रखता है।

समस्या क्या है? जैसे-जैसे किताब लंबी होती जाती है, यह स्क्रैचपैड बहुत बड़ा होता जाता है। अंततः, लाइब्रेरियन के पास डेस्क की जगह (मेमोरी) खत्म हो जाती है, और उन्हें नए पन्नों के लिए जगह बनाने हेतु पुराने पन्नों को फेंकना पड़ता है।

पुराना तरीका: "सब-या-कुछ-नहीं" वाला कूड़ेदान

पहले, लाइब्रेरियन एक सरल नियम का उपयोग करते थे: "यदि कोई पन्ना अभी बहुत महत्वपूर्ण नहीं है, तो उसे हमेशा के लिए कचरे में फेंक दो।"

  • समस्या: यह एक पन्ने को सिर्फ इसलिए फेंक देने जैसा है क्योंकि आप इस क्षण उसमें नहीं देख रहे हैं। भले ही आपको उसकी तुरंत आवश्यकता न हो, लेकिन उस पन्ने में ऐसा तथ्य हो सकता है जिसका आप बाद में आसानी से अनुमान लगा सकते हैं या पुनर्निर्माण कर सकते हैं। उसे पूरी तरह से फेंक देने से, आप वह जानकारी हमेशा के लिए खो देते हैं।

नया तरीका: VECTOR (एक "तीन-दराज" वाली प्रणाली)

यह शोध पत्र VECTOR नामक एक नई प्रणाली पेश करता है, जो लाइब्रेरियन को "रखें" या "फेंकें" के बजाय तीन अलग-अलग दराजें देती है।

  1. "रखें" दराज (Retention): सबसे महत्वपूर्ण पन्नों के लिए (जैसे मुख्य पात्र का नाम या कहानी का मोड़), लाइब्रेरियन मूल, सटीक प्रति रखता है।
  2. "कचरा" दराज (Eviction): उन पन्नों के लिए जो वास्तव में अप्रासंगिक हैं (जैसे अध्याय के बीच में कोई रैंडम विज्ञापन), उन्हें पूरी तरह से फेंक दिया जाता है।
  3. "स्केच" दराज (Approximation): यह जादुई नया चरण है। उन पन्नों के लिए जो कुछ हद तक महत्वपूर्ण हैं लेकिन बहुत महत्वपूर्ण नहीं हैं, लाइब्रेरियन उन्हें पूरी तरह से नहीं फेंकता। इसके बजाय, वह पूरा टेक्स्ट फेंक देता है लेकिन एक सरल स्केच या एक गणितीय संकेत रखता है जिससे जरूरत पड़ने पर वह उस पन्ने को बाद में फिर से बना सके।

"स्केच" कैसे काम करता है?

शोध पत्र बताता है कि इन AI मॉडलों में, "Key" (पन्ने पर लगा लेबल) और "Value" (वास्तविक सामग्री) गणितीय रूप से जुड़े हुए हैं, जैसे ताले और उसकी चाबी।

  • अंतर्दृष्टि: "Key" बहुत संवेदनशील होती है; यदि आप इसे बिगाड़ देते हैं, तो लाइब्रेरियन भ्रमित हो जाता है कि कहाँ देखना है। लेकिन "Value" (सामग्री) अधिक सहिष्णु है।
  • ट्रिक: VECTOR "Key" को सुरक्षित रखता है। फिर, यह एक पूर्व-निर्धारित गणितीय सूत्र (जिसे OLS कहा जाता है) का उपयोग करता है ताकि यह अनुमान लगाया जा सके कि उस Key के आधार पर "Value" कैसी दिखनी चाहिए।
  • परिणाम: यदि अनुमान अच्छा है (जो कि यह शोध पत्र सिद्ध करता है कि आमतौर पर होता है), तो लाइब्रेरियन केवल Key और सूत्र को स्टोर करके भारी मात्रा में जगह बचा लेता है, बजाय पूरे भारी टेक्स्ट को रखने के। यदि अनुमान खराब है, तो वे पूरा टेक्स्ट रखते हैं।

"तीन-तरफा" निर्णय प्रक्रिया

जब लाइब्रेरियन को जगह बनाने की आवश्यकता होती है, तो VECTOR प्रत्येक पन्ने के लिए दो प्रश्न पूछता है:

  1. क्या यह पन्ना महत्वपूर्ण है? (यदि नहीं \rightarrow कचरे में फेंक दें)।
  2. यदि यह महत्वपूर्ण है, तो क्या हम इसे इसके लेबल से आसानी से फिर से बना सकते हैं?
    • यदि हाँ (पुनर्निर्माण आसान है) \rightarrow इसे "स्केच" दराज में रखें (जगह बचाएं)।
    • यदि नहीं (पुनर्निर्माण कठिन है) \rightarrow पूर्ण प्रति रखें (सटीकता बचाएं)।

उन्होंने क्या पाया?

लेखकों ने कई AI मॉडलों पर परीक्षण किया जिनके पास बहुत सख्त मेमोरी सीमाएं थीं (जैसे एक पूरे विश्वकोश को जूते के डिब्बे में फिट करने की कोशिश करना)।

  • परिणाम: इस "स्केच दराज" का उपयोग करके, मॉडलों ने पहले की तुलना में बहुत बेहतर प्रदर्शन किया, विशेष रूप से जब मेमोरी बहुत कम थी। वे बिना अधिक कंप्यूटर मेमोरी की आवश्यकता के अधिक विवरण याद रख सके और प्रश्नों के अधिक सटीक उत्तर दे सके।
  • सावधानी: यह तब सबसे अच्छा काम करता है जब लाइब्रेरियन पहले से ही बहुत अधिक चयनात्मक (picky) न हो रहा हो। यदि लाइब्रेरियन पहले से ही केवल सबसे उत्तम पन्नों को रखने पर ध्यान केंद्रित कर रहा है, तो "स्केच" ट्रिक का उपयोग करने के लिए बहुत कम जगह बचती है।

संक्षेप में

VECTOR AI मेमोरी प्रबंधन के लिए एक स्मार्ट अपग्रेड है। केवल "रखें" या "फेंकें" तय करने के बजाय, यह एक बीच का विकल्प जोड़ता है: "एक संकेत रखें ताकि हम इसे बाद में फिर से बना सकें।" यह AI मॉडलों को लंबी कहानियों और जटिल कार्यों को संभालने में मदद करता है, बिना मेमोरी खत्म किए, बस इस बात में स्मार्ट बनकर कि वे क्या फेंक रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →