← नवीनतम पेपर
🤖 machine learning

RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache

RDKV एक नवीन KV कैश संपीड़न (compression) विधि है जो एक रेट-डिस्टॉर्शन फ्रेमवर्क के माध्यम से टोकन इविक्शन (eviction) और क्वांटाइजेशन (quantization) को संयुक्त रूप से अनुकूलित करती है, जिससे लंबी-संदर्भ (long-context) वाली कार्यों पर उच्च सटीकता बनाए रखते हुए महत्वपूर्ण मेमोरी कमी और डिकोडिंग गति में वृद्धि प्राप्त होती है।

मूल लेखक: Junkai Zhang, Hang Guo, Luca Benini, Yawei Li

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junkai Zhang, Hang Guo, Luca Benini, Yawei Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी कहानी याद रखने की कोशिश कर रहे हैं ताकि बाद में आप उसके बारे में सवालों के जवाब दे सकें। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इस "याददाश्त" को KV Cache कहा जाता है।

जैसे-जैसे कहानी लंबी होती जाती है (हजारों या लाखों शब्द), यह मेमोरी कंप्यूटर की हार्ड ड्राइव (विशेष रूप से, इसकी हाई-स्पीड मेमोरी) में बहुत अधिक जगह घेर लेती है। हर बार जब AI अगला शब्द बनाने की कोशिश करता है, तो उसे इस विशाल मेमोरी को फिर से पढ़ना पड़ता है। यह एक लाइब्रेरी में किसी विशिष्ट वाक्य को खोजने के लिए हर बार हर एक किताब को वापस शेल्फ में रखने और उसे फिर से पढ़ने जैसा है। यह धीमा है, और यह बहुत जल्दी जगह खत्म कर देता है।

इसे ठीक करने के लिए, वैज्ञानिकों ने अब तक दो मुख्य तरकीबें आजमाई हैं:

  1. "कचरे का डिब्बा" विधि (Eviction): उन हिस्सों को फेंक दें जिन्हें आप महत्वपूर्ण नहीं समझते।
  2. "शॉर्टहैंड" विधि (Quantization): महत्वपूर्ण हिस्सों को कम अक्षरों का उपयोग करके फिर से लिखें (जैसे "you" के बजाय "u" लिखना) ताकि जगह बचाई जा सके।

समस्या यह है कि पिछले तरीकों ने इन्हें अलग-अलग विकल्पों के रूप में माना। या तो आप पूरा पैराग्राफ फेंक देते थे, या आप पूरी किताब को सिकोड़ देते थे। लेकिन कुछ पैराग्राफ महत्वपूर्ण होते हैं, कुछ ठीक-ठाक होते हैं, और कुछ बेकार होते हैं। एक बाइनरी "रखो या फेंको" वाला दृष्टिकोण बहुत ही रूखा (blunt) है।

समाधान: RDKV (एक स्मार्ट लाइब्रेरियन)

यह पेपर RDKV पेश करता है, जो इस मेमोरी को प्रबंधित करने का एक नया तरीका है। सोचिए कि RDKV एक सुपर-स्मार्ट लाइब्रेरियन है जो केवल यह तय नहीं करता कि क्या फेंकना है, बल्कि यह भी तय करता है कि जानकारी के हर एक टुकड़े को कितनी महत्वपूर्णता के आधार पर कैसे स्टोर करना है।

यह इस प्रकार काम करता है, एक सरल उपमा (analogy) का उपयोग करते हुए:

1. "डिस्टॉर्शन" स्कोर (हम कितना खो देंगे?)

कोई भी बदलाव करने से पहले, RDKV कहानी के हर वाक्य (टोकन) और हर अवधारणा (चैनल) को देखता है। यह पूछता है: "यदि मैं इसे हटा दूँ, या यदि मैं इसे शॉर्टहैंड में लिख दूँ, तो कहानी कितनी बदल जाएगी?"

  • यदि कोई वाक्य अत्यंत महत्वपूर्ण है (जैसे मुख्य प्लॉट ट्विस्ट), तो उसे हटाने से कहानी बर्बाद हो जाएगी। इसका स्कोर उच्च (high) होगा।
  • यदि कोई वाक्य सिर्फ "उम" या "आसमान नीला था" जैसा है, तो उसे हटाने से बहुत कम फर्क पड़ेगा। इसका स्कोर निम्न (low) होगा।

2. "रिवर्स वॉटर-फिलिंग" (बजट)

कल्पना कीजिए कि आपके पास स्टोरेज स्पेस की एक निश्चित मात्रा (बजट) है। आप उसमें कहानी के सबसे महत्वपूर्ण हिस्सों को भरना चाहते हैं।
RDKV रिवर्स वॉटर-फिलिंग नामक एक गणितीय ट्रिक का उपयोग करता है। कल्पना कीजिए कि आपके पास पानी की एक बाल्टी (आपका मेमोरी बजट) है और पहाड़ियों और घाटियों का एक परिदृश्य (महत्व के स्कोर) है।

  • ऊंची पहाड़ियाँ (महत्वपूर्ण जानकारी): आप यहाँ गहरा पानी भरते हैं ताकि वे पूरी तरह से दिखाई दें (Full Precision/16-bit)।
  • मध्यम पहाड़ियाँ (ठीक-ठाक जानकारी): आप बस इतना पानी डालते हैं कि वे ढक जाएं, लेकिन बहुत गहरा नहीं (Low Precision/4-bit या 8-bit)।
  • निचली घाटियाँ (बेकार जानकारी): आप बिल्कुल भी पानी नहीं डालते। ये क्षेत्र सूखे रहते हैं और प्रभावी रूप से फेंक दिए जाते हैं (0-bit/Eviction)।

यही इस पेपर की बड़ी सफलता है: चीजों को फेंकना और चीजों को सिकोड़ना अब एक ही निरंतर योजना का हिस्सा हैं। आप पहले "रखो या फेंको" का निर्णय नहीं लेते; गणित एक साथ आपके बजट में फिट होने के लिए "पूर्ण विवरण," "शॉर्टहैंड," और "खत्म" का सही मिश्रण तय करता है।

3. "ट्राइज़ोन" (TriZone) पैकिंग (एक कुशल शेल्फ)

एक बार जब लाइब्रेरियन यह तय कर लेता है कि क्या रखना है और किसे सिकोड़ना है, तो डेटा को कुशलतापूर्वक स्टोर करने की आवश्यकता होती है। यदि आप केवल डेटा को सिकोड़ देते हैं, तो कंप्यूटर को इसे पढ़ने के लिए फिर से अनपैक करना पड़ता है, जो धीमा है।
RDKV एक विशेष स्टोरेज लेआउट का उपयोग करता है जिसे TriZone कहा जाता है।

  • ज़ोन A: "शॉर्टहैंड" नोट्स, जो कसकर पैक किए गए हैं।
  • ज़ोन B: "पूर्ण विवरण" वाले नोट्स, जिन्हें वैसा ही रखा गया है।
  • ज़ोन C: अभी जोड़े जा रहे नए शब्द।

जादू यह है कि कंप्यूटर इन विभिन्न ज़ोन को पहले अनपैक किए बिना सीधे पढ़ सकता है। यह एक ऐसी लाइब्रेरी की तरह है जहाँ लाइब्रेरियन शॉर्टहैंड नोट्स को पूर्ण वाक्यों में फिर से लिखे बिना सीधे पढ़ सकता है। यह प्रक्रिया को अविश्वसनीय रूप से तेज़ बनाता है।

परिणाम

इस पेपर ने विभिन्न AI मॉडल्स और बहुत लंबी कहानियों (1,28,000 शब्दों तक, और कुछ परीक्षणों में 2 मिलियन तक) पर इस सिस्टम का परीक्षण किया।

  • सटीकता (Accuracy): RDKV ने मूल AI की 97.8% सटीकता बनाए रखी, भले ही इसने मूल मेमोरी स्पेस का केवल 2.5% ही उपयोग किया हो।
  • गति (Speed): इसने मानक पद्धति की तुलना में उत्तर उत्पन्न करने की गति को 4.5 गुना तेज़ कर दिया।
  • मेमोरी: इसने मेमोरी की आवश्यकता को लगभग आधा कर दिया, जिससे AI को उन मानक कंप्यूटरों पर चलने में मदद मिली जहाँ पहले मेमोरी खत्म होने के कारण यह क्रैश हो जाता था।

संक्षेप में, RDKV मेमोरी संपीड़न (compression) को केवल "रखो या फेंको" के खेल के रूप में नहीं देखता। इसके बजाय, यह एक मास्टर शेफ की तरह कार्य करता है, जो व्यंजन के हर हिस्से को सही मात्रा में मसाला (प्रिसिजन) लगाकर उसे स्वादिष्ट (सटीक) बनाता है, बिना किसी सामग्री (मेमोरी) को बर्बाद किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →