← नवीनतम पेपर
💬 NLP

NestedKV: Nested Memory Routing for Long-Context KV Cache Compression

NestedKV एक प्रशिक्षण-मुक्त (training-free), केवल-की (key-only) KV कैश संपीड़न विधि है जो वैश्विक, ब्लॉक-स्तरीय और स्लाइडिंग-विंडो एंकरों के साथ एक मल्टी-स्केल मेमोरी रूटिंग रणनीति का उपयोग करती है ताकि लॉन्ग-कॉन्टेक्स्ट लैंग्वेज मॉडल्स में, विशेष रूप से सख्त मेमोरी बाधाओं के तहत, मौजूदा बेसलाइन्स से काफी बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Hong Chen, Xiang Liu, Yubo Gao, Yuxuan Fan, Bo Wang, Yuanlin Chu, Yuanguo Lin, Xuming Hu

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hong Chen, Xiang Liu, Yubo Gao, Yuxuan Fan, Bo Wang, Yuanlin Chu, Yuanguo Lin, Xuming Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ NestedKV पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों में विभाजित किया गया है।

बड़ी समस्या: "बहुत अधिक सामग्री" की बाधा (The "Too Much Stuff" Bottleneck)

कल्पना कीजिए कि आप एक सुपर-स्मार्ट लाइब्रेरियन (AI) हैं जिसने अभी-अभी एक विशाल विश्वकोश (लंबे टेक्स्ट प्रॉम्प्ट) पढ़ा है। अपने अगले प्रश्न का उत्तर देने के लिए, आपको याद रखने की आवश्यकता है कि आपने अभी क्या पढ़ा है।

वर्तमान AI मॉडलों में, लाइब्रेरियन द्वारा पढ़े गए प्रत्येक शब्द के लिए इंडेक्स कार्ड्स का एक भौतिक ढेर (KV Cache) रखता है।

  • समस्या: यदि किताब 1,00,000 शब्दों की है, तो कार्ड्स का ढेर बहुत बड़ा हो जाता है। यह डेस्क पर इतनी जगह घेर लेता है कि लाइब्रेरियन कुशलता से काम नहीं कर पाता, या डेस्क उसके भार से ढह जाता है।
  • वर्तमान समाधान: मौजूदा तरीके एक सरल नियम के आधार पर कार्ड्स को फेंकने की कोशिश करते हैं: "यदि कोई शब्द हाल ही में उल्लेखित हुआ है या उसे बहुत बार देखा गया है, तो उसे रखें। यदि नहीं, तो उसे फेंक दें।"
  • दोष: यह उस लाइब्रेरियन की तरह है जो केवल वही याद रखता है जो उसने पिछला पन्ना पढ़ा है। वह अध्याय 1 के किसी महत्वपूर्ण पात्र के नाम को फेंक सकता है क्योंकि उसने अध्याय 50 में उसे नहीं देखा है, भले ही पूरी कहानी उस पर निर्भर करती हो। जब ढेर बहुत छोटा हो जाता है, तो यह "एक-नियम" वाला दृष्टिकोण बुरी तरह विफल हो जाता है।

समाधान: NestedKV (एक "तीन-स्तरीय" स्मृति)

लेखक इन इंडेक्स कार्ड्स को प्रबंधित करने का एक नया तरीका प्रस्तावित करते हैं जिसे NestedKV कहा जाता है। केवल एक नियम का उपयोग करने के बजाय, वे एक तीन-स्तरीय स्मृति प्रणाली का उपयोग करते हैं जो इस बात से प्रेरित है कि मानव स्मृति कैसे काम करती है।

सोचिए कि अब लाइब्रेरियन के पास यह तय करने के लिए तीन अलग-अलग मानसिक "बाल्टियाँ" (Buckets) हैं कि कौन से कार्ड महत्वपूर्ण हैं:

  1. "स्थिर" बाल्टी (पूरी किताब - The "Stable" Bucket):
    • यह क्या करती है: सामान्य विषय क्या है यह देखने के लिए पूरी किताब को देखती है।
    • उदाहरण: "क्या यह एक सामान्य शब्द है जैसे 'the' या 'and' जो हर जगह दिखाई देता है? यदि हाँ, तो यह शायद इतना अनूठा नहीं है कि इसे रखा जाए।"
  2. "एपिसोडिक" बाल्टी (अध्याय - The "Episodic" Bucket):
    • यह क्या करती है: वर्तमान अध्याय या अनुभाग को देखती है।
    • उदाहरण: "क्या यह शब्द अभी इस विशिष्ट दृश्य में महत्वपूर्ण है? भले ही यह पूरी किताब में न हो, लेकिन यह इस पैराग्राफ के रहस्य को सुलझाने की कुंजी हो सकता है।"
  3. "वर्तमान" बाल्टी (अंतिम वाक्य - The "Current" Bucket):
    • यह क्या करती है: पिछले कुछ शब्दों को देखती है।
    • उदाहरण: "क्या हमने अभी यह कहा? यदि यह बिल्कुल नया है, तो हमें अगले सेकंड के लिए इसे निश्चित रूप से रखना होगा।"

यह तय कैसे करता है कि क्या रखना है: "आश्चर्य" का मीटर (The "Surprise" Meter)

NestedKV का असली जादू यह है कि यह इन तीन बाल्टियों को कैसे जोड़ता है। यह केवल उन्हें औसत (average) नहीं निकालता; यह एक स्मार्ट मैनेजर की तरह काम करता है जो भ्रमित हो जाता है जब बाल्टियाँ आपस में असहमत होती हैं।

  • "मिश्रित" दृष्टिकोण (The "Blended" View): आमतौर पर, तीनों बाल्टियाँ सहमत होती हैं। यदि कोई शब्द वैश्विक (globally), स्थानीय (locally) और हालिया (recently) रूप से महत्वपूर्ण है, तो मैनेजर उसे रखता है।
  • "आश्चर्य" का संकेत (The "Surprise" Signal): कभी-कभी, बाल्टियाँ असहमत होती हैं।
    • उदाहरण: एक शब्द पूरी किताब के लिए उबाऊ (boring) हो सकता है (Stable) और वर्तमान वाक्य के लिए भी उबाऊ (Current) हो सकता है, लेकिन वह इस विशिष्ट अध्याय के लिए अत्यंत अनूठा (wildly unique) हो सकता है (Episodic)।
    • प्रतिक्रिया: मैनेजर इस असहमति से "आश्चर्यचकित" हो जाता है। औसत निकालने और संभावित रूप से शब्द को फेंक देने के बजाय, मैनेजर कहता है, "रुको, इनमें से एक बाल्टी मानती है कि यह बहुत महत्वपूर्ण है! मैं उस पर भरोसा करूँगा और उस कार्ड को रखूँगा।"

यह "सरप्राइज" तंत्र सुनिश्चित करता है कि यदि स्मृति प्रणाली का कोई भी हिस्सा किसी टोकन को महत्वपूर्ण बताता है, तो वह बच जाता है।

परिणाम: यह क्यों मायने रखता है

पेपर ने विभिन्न AI मॉडलों (जैसे Qwen और Llama) पर बहुत लंबे टेक्स्ट के साथ इस पद्धति का परीक्षण किया।

  • जब डेस्क भीड़भाड़ वाला हो (कम संपीड़न/Low Compression): सभी तरीके ठीक से काम करते हैं।
  • जब डेस्क बहुत छोटा हो (उच्च संपीड़न/High Compression): यहीं पर NestedKV चमकता है।
    • पुराने तरीके (जैसे "सबसे हालिया को रखें") गलत कार्ड फेंकने लगते हैं, और AI तथ्य गढ़ने लगता है या कहानी भूलने लगता है।
    • NestedKV सही कार्ड रखता है क्योंकि यह शब्द को तीन अलग-अलग कोणों से जाँचता है। यहाँ तक कि जब मेमोरी को केवल 25% तक सीमित करने के लिए मजबूर किया जाता है, तब भी यह प्रतिस्पर्धा से बहुत बेहतर प्रदर्शन करता है।

एक वाक्य में सारांश

NestedKV AI की स्मृति को सिकोड़ने का एक स्मार्ट तरीका है, जो यह जाँचता है कि क्या कोई जानकारी तीन अलग-अलग दृष्टिकोणों (पूरी कहानी, वर्तमान दृश्य और तत्काल क्षण) से महत्वपूर्ण है, और यह उस चीज़ को सुरक्षित रखता है जो उन तीन दृष्टिकोणों में से किसी एक को भी आश्चर्यचकित करती है, जिससे यह सुनिश्चित होता है कि AI महत्वपूर्ण विवरण न खो दे, भले ही मेमोरी बहुत कम क्यों न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →