← नवीनतम पेपर
🤖 machine learning

MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference

MomentKV कॉम्पैक्ट मोमेंट सांख्यिकी (moment statistics) को बनाए रखकर और हटाए गए टोकन के उनके अटेंशन योगदान के लिए एक क्लोज्ड-फॉर्म सुधार प्रदान करके, लॉन्ग-कॉन्टेक्स्ट KV कैश इविक्शन में दिशात्मक बेमेल (directional mismatch) बाधा को संबोधित करता है ताकि हटाए गए टोकन की ज्यामितीय नियमितता (geometric regularity) सुनिश्चित की जा सके, जिससे यह विभिन्न बेंचमार्क और संपीड़न स्तरों पर मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Yu Li, Binxu Li, Tian Lan

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yu Li, Binxu Li, Tian Lan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी कहानी को याद रखने की कोशिश कर रहे हैं ताकि आप उसे आगे लिख सकें। इसे करने के लिए, आपका मस्तिष्क अब तक पढ़ी गई हर चीज़ का एक "रफ नोट" (जिसे KV Cache कहते हैं) अपने पास रखता है। समस्या यह है कि जैसे-जैसे कहानी लंबी होती जाती है, यह रफ नोट बहुत बड़ा होता जाता है, और अंततः आपकी पूरी मेज को भर देता है जिससे काम करना असंभव हो जाता है।

इसे ठीक करने के लिए, वर्तमान तरीके एक "कचरा पात्र" (trash can) रणनीति का उपयोग करते हैं: वे कहानी को देखते हैं, उन सबसे महत्वपूर्ण वाक्यों को चुनते हैं जिन्हें मेज पर रखना है, और बाकी को कचरे में फेंक देते हैं। वे यह मान लेते हैं कि यदि वे "सर्वश्रेष्ठ" वाक्यों को रखते हैं, तो वे बाकी को अनदेखा कर सकते हैं।

पेपर की बड़ी खोज: "दिशा" की समस्या
इस पेपर के लेखकों ने, MOMENTKV, महसूस किया कि इस "कचरा पात्र" दृष्टिकोण में एक छिपा हुआ दोष है।

कल्पना कीजिए कि आप कुछ पत्तों के आधार पर हवा की दिशा का अनुमान लगाने की कोशिश कर रहे हैं जिन्हें आपने अपनी मेज पर रखा है।

  • पुराना तरीका: आप उन पत्तों को रखते हैं जो सबसे ज़ोर से बह रहे हैं (सबसे "महत्वपूर्ण" वाले) और बाकी को कचरे में फेंक देते हैं। फिर आप केवल मेज पर मौजूद पत्तों का उपयोग करके हवा की दिशा का अनुमान लगाने की कोशिश करते हैं।
  • समस्या: जो पत्ते आपने फेंक दिए हैं, वे पूरी तरह से अलग दिशा में (उनसे लंबवत/perpendicular) बह रहे हो सकते हैं जिन्हें आपने रखा है। भले ही आपने 90% पत्ते फेंक दिए हों, यदि बचे हुए 10% उत्तर की ओर इशारा कर रहे हैं और कचरा पूर्व की ओर इशारा कर रहा है, तो आपका अनुमान पूरी तरह से गलत होगा। आप केवल उत्तर वाले पत्तों को फिर से व्यवस्थित (re-calculate) करके उस गायब पूर्व की हवा को ठीक नहीं कर सकते; त्रुटि इस बारे में नहीं है कि आपने कितना फेंक दिया; यह उस दिशा के बारे में है जिसे आपने खो दिया।

समाधान: MOMENTKV
कचरे को फेंकने और सबसे अच्छे की उम्मीद करने के बजाय, MOMENTKV कचरे में जाने से पहले उसके बारे में एक छोटा, अत्यंत संक्षिप्त "सारांश नोट" रखता है।

इसे इस प्रकार समझें:

  1. सारांश नोट (Moment Statistics): किसी वाक्य को फेंकने से पहले, सिस्टम तेज़ी से उसके बारे में कुछ सरल संख्याएँ निकालता है: "औसत अर्थ क्या था?" और "अगले शब्द के साथ यह अर्थ आमतौर पर कैसे बदलता है?" यह पूरा वाक्य स्टोर नहीं करता, बस ये कुछ "मोमेंट्स" (जैसे कि एक सांख्यिकीय फिंगरप्रिंट) रखता है।
  2. स्मार्ट फेंकना: यह तय करते समय कि क्या फेंकना है, सिस्टम पूछता है: "क्या यह वाक्य मेरे सारांश नोट्स द्वारा अच्छी तरह से दर्शाया गया है?" यदि हाँ, तो इसे फेंकना सुरक्षित है। यदि नहीं (इसमें एक अनूठी दिशा है जिसे सारांश कैप्चर नहीं करता), तो यह उसे रखता है। यह सुनिश्चित करता है कि "कचरा" ज्यामितीय रूप से नियमित और अनुमानित बना रहे।
  3. जादुई सुधार (Magic Correction): जब मॉडल को अगला शब्द लिखने की आवश्यकता होती है, तो वह केवल मेज पर मौजूद वाक्यों को नहीं देखता है। वह कचरे में मौजूद वाक्यों के बारे में उन छोटे "सारांश नोट्स" का उपयोग करके गणितीय रूप से यह पुनर्निर्माण करता है कि गायब वाक्यों ने क्या योगदान दिया होगा। यह अनिवार्य रूप से कहता है, "मुझे पता है कि मैंने इन्हें फेंक दिया है, लेकिन मेरे नोट्स के आधार पर, मैं अनुमान लगा सकता हूँ कि वे कहानी को इस विशिष्ट दिशा में धकेल रहे थे, इसलिए मैं उस प्रभाव को वापस जोड़ दूँगा।"

यह क्यों काम करता है
पेपर ने दो प्रसिद्ध AI मॉडलों (LLaMA और Qwen) पर दो बेंचमार्क (LongBench और RULER) का उपयोग करके इसका परीक्षण किया।

  • परिणाम: MOMENTKV ने अन्य सभी तरीकों को लगातार पछाड़ दिया, विशेष रूप से तब जब "मेज की जगह" बहुत कम थी (आक्रामक संपीड़न/compression)।
  • उपमा: यह एक ऐसे लाइब्रेरियन की तरह है जो न केवल शेल्फ पर सबसे लोकप्रिय किताबें रखता है, बल्कि बेसमेंट में मौजूद हर किताब के लिए एक छोटा इंडेक्स कार्ड भी रखता है। जब आप कोई प्रश्न पूछते हैं, तो लाइब्रेरियन उन इंडेक्स कार्डों का उपयोग करके बेसमेंट की किताबों के सार को तुरंत याद कर सकता है, जिससे आपको बेसमेंट को पूरी तरह से अनदेखा करने की तुलना में बहुत बेहतर उत्तर मिलता है।

संक्षेप में
वर्तमान AI तरीके पुराने संदर्भ को फेंक देते हैं और उम्मीद करते हैं कि बचे हुए हिस्से पर्याप्त होंगे। MOMENTKV यह समझता है कि फेंके गए हिस्सों की दिशा उतनी ही महत्वपूर्ण है जितना कि वे हिस्से स्वयं। फेंके गए "कचरे" के एक छोटे, स्मार्ट सारांश को रखकर और उस सारांश का उपयोग करके AI की स्मृति को गणितीय रूप से ठीक करके, यह मॉडल को अपनी जगह खोए बिना या गलतियाँ किए बिना बहुत लंबी कहानियों को संभालने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →