← नवीनतम पेपर
💬 NLP

DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity

DeltaKV एक रेसिड्यूअल-आधारित KV कैश कंप्रेशन फ्रेमवर्क है जो मेमोरी उपयोग को मूल का 29% तक कम करने के लिए लॉन्ग-रेंज टोकन समानता का लाभ उठाता है, जिसे लॉन्ग-कॉन्टेक्स्ट परिदृश्यों में 2×\times तक थ्रूपुट सुधार प्राप्त करने के लिए एक हाई-परफॉर्मेंस स्पार्स-vLLM इंजन के साथ जोड़ा गया है।

मूल लेखक: Jitai Hao, Qiang Huang, Yaowei Wang, Min Zhang, Jun Yu

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jitai Hao, Qiang Huang, Yaowei Wang, Min Zhang, Jun Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हज़ार पन्नों का महाकाव्य उपन्यास लिखने की कोशिश कर रहे हैं। अपनी कहानी को सुसंगत बनाए रखने के लिए, आपको अब तक लिखी गई हर चीज़ को याद रखने की ज़रूरत है—हर पात्र की आँखों का रंग, हर मोड़ (plot twist), और हर सेटिंग।

आर्टिफिशियल इंटेलिजेंस (LLMs) की दुनिया में, इस "याददाश्त" को KV Cache कहा जाता है। समस्या यह है कि जैसे-जैसे कहानी लंबी होती जाती है, इसके लिए आवश्यक मेमोरी इतनी विशाल हो जाती है कि अंततः यह कंप्यूटर के "दिमाग" (GPU) को क्रैश कर देती है।

वर्तमान में, AI शोधकर्ता इसे दो तरीकों से हल करने का प्रयास करते हैं:

  1. इरेज़र विधि (Eviction): वे जगह बचाने के लिए पुराने पन्नों को बस फेंक देते हैं। लेकिन यदि आप वह पन्ना फेंक देते हैं जहाँ आपने विलेन (खलनायक) का परिचय दिया था, तो कहानी समझ से बाहर हो जाएगी।
  2. हाइलाइटर विधि (Sparsity): वे सब कुछ रखते हैं लेकिन केवल कुछ "हाइलाइट किए गए" हिस्सों को ही "देखते" हैं। इससे समय तो बचता है, लेकिन यह वास्तव में लाइब्रेरी में भौतिक स्थान (physical space) नहीं बचाता है।

DeltaKV एक तीसरा, बहुत अधिक स्मार्ट तरीका है। यह कैसे काम करता है, इसके लिए तीन सरल उपमाएँ (analogies) यहाँ दी गई हैं:

1. "संदर्भ फोटो" रणनीति (Long-Range Similarity)

कल्पना कीजिए कि आप हज़ारों अपराध स्थल की तस्वीरों को देख रहे एक जासूस हैं। हर तस्वीर के हर एक पिक्सेल को याद करने के बजाय, आप महसूस करते हैं कि कई तस्वीरें लगभग एक जैसी दिखती हैं।

1,000 पूरी तस्वीरें संग्रहीत करने के बजाय, आप 10 "मास्टर संदर्भ फोटो" चुनते हैं। बाकी हर फोटो के लिए, आप पूरी इमेज को सहेजते नहीं हैं; बल्कि आप केवल एक छोटा सा नोट लिखते हैं: "यह फोटो संदर्भ फोटो #3 के बिल्कुल समान है, लेकिन संदिग्ध ने नीली टोपी के बजाय लाल टोपी पहनी है।"

DeltaKV बिल्कुल यही करता है। यह महसूस करता है कि AI की मेमोरी के कई हिस्से दोहराव वाले होते हैं। यह कुछ "संदर्भ टोकन" (Reference Tokens) को सहेजता है और बाकी सब चीज़ों के लिए, यह केवल "डेल्टा" (अंतर) को स्टोर करता है। इसीलिए यह कहानी को खोए बिना अपनी मेमोरी के उपयोग को मूल आकार के मात्र 29% तक सिकोड़ सकता है।

2. "स्केच बनाम ऑयल पेंटिंग" अवधारणा (Highly Shared Components)

एक लैंडस्केप पेंटिंग के बारे में सोचें। कैनवास का अधिकांश हिस्सा "साझा" चीज़ों से भरा होता है: आकाश का नीला रंग, घास का हरा रंग, और बादलों की बनावट। जब भी आप किसी पेड़ का उल्लेख करते हैं, तो आपको नीले आकाश का वर्णन करने की आवश्यकता नहीं होती।

DeltaKV ने देखा कि KV कैश में "High-Norm Latent Components" होते हैं—मूल रूप से, बहुत सारा "नीला आकाश" जो सभी टोकन में सामान्य है। DeltaKV उस सभी सामान्य "बैकग्राउंड नॉइज़" को हटा देता है और केवल अद्वितीय "विवरणों" (विशिष्ट पेड़ या विशिष्ट पक्षी) को स्टोर करता है। क्योंकि "विवरण" पूरे "पेंटिंग" की तुलना में बहुत छोटे और सरल होते हैं, इसलिए उन्हें कंप्रेस करना अविश्वसनीय रूप से आसान होता है।

3. "एक्सप्रेस लेन" (Sparse-vLLM)

भले ही आपके पास एक छोटी, कंप्रेस्ड नोटबुक हो, फिर भी आपको उसे पढ़ने के लिए एक तेज़ तरीके की आवश्यकता होगी। यदि आपको हर छोटे नोट को डिकोड करने में दस मिनट खर्च करने पड़ते हैं, तो आप उपयोगी होने के लिए बहुत धीमे होंगे।

शोधकर्ताओं ने Sparse-vLLM नामक एक विशेष इंजन बनाया है। इसे "शॉर्टहैंड नोट्स" (संक्षिप्त नोट्स) को पढ़ने के लिए डिज़ाइन किया गया एक हाई-स्पीड स्कैनर समझें। क्योंकि यह जानता है कि DeltaKV नोट्स की संरचना कैसी है, यह सीधे "शॉर्टहैंड" पर कूद सकता है और "पूरी किताबों" को छोड़ सकता है, जिससे AI पहले की तुलना में 2 गुना तेज़ काम कर पाता है।

निचोड़ (The Bottom Line)

DeltaKV एक भारी-भरकम लाइब्रेरी के विशाल, भारी किताबों को "मास्टर रेफरेंस" और "त्वरित शॉर्टहैंड नोट्स" के एक पतले, कुशल फोल्डर में बदल देता है।

परिणाम: आप AI को पढ़ने और लिखने के लिए बहुत लंबी "कहानियाँ" (लंबा संदर्भ) दे सकते हैं, यह बहुत कम महंगे हार्डवेयर का उपयोग करता है, और यह सब कुछ बिना यह भूले कि विलेन कौन है, सफलतापूर्वक करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →