← नवीनतम पेपर
💬 NLP

IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference

IndexMem एक सीखने योग्य इंडेक्सर (learnable indexer) को सटीक टोकन इविक्शन (token eviction) के लिए और एक हल्के लेटेंट मेमोरी मॉड्यूल (lightweight latent memory module) को छोड़ी गई जानकारी को संरक्षित करने के लिए जोड़कर लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस में KV-कैशे बाधा (KV-cache bottleneck) को संबोधित करता है, जिससे विभिन्न मॉडलों और बेंचमार्क में प्रदर्शन और स्थिरता में काफी सुधार होता है।

मूल लेखक: Xintong Yang, Hao Gu, Binxing Xu, Lujun Li, Bei Liu, Jiacheng Liu, Qiyuan Zhu, Sirui Han, Yike Guo

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xintong Yang, Hao Gu, Binxing Xu, Lujun Li, Bei Liu, Jiacheng Liu, Qiyuan Zhu, Sirui Han, Yike Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही महत्वपूर्ण प्रश्न का उत्तर देने के लिए पहले पृष्ठ के बारे में एक अत्यंत विस्तृत, 1,000 पन्नों के उपन्यास को पढ़ने की कोशिश कर रहे हैं। जैसे-जैसे आप पढ़ते हैं, आपका मस्तिष्क स्वाभाविक रूप से आपके द्वारा देखे गए हर शब्द को याद रखने की कोशिश करता है। लेकिन यहाँ समस्या यह है: आपके मस्तिष्क में "वर्किंग मेमोरी" (कार्यशील स्मृति) की एक सीमित मात्रा होती है। यदि आप पृष्ठ 1 से पृष्ठ 1,000 तक के हर एक शब्द को एक साथ अपने दिमाग में रखने की कोशिश करेंगे, तो आप अभिभूत हो जाएंगे, धीमे हो जाएंगे, या पूरी तरह से जगह खत्म हो जाएगी।

यह बिल्कुल वही समस्या है जिसका सामना बड़े भाषा मॉडल (LLMs) लंबे दस्तावेजों को संभालते समय करते हैं। वे जो कुछ भी पढ़ रहे हैं उसे याद रखने के लिए "KV कैश" नामक एक "मेमोरी बैंक" का उपयोग करते हैं। जैसे-जैसे टेक्स्ट लंबा होता जाता है, यह मेमोरी बैंक बढ़ता जाता है जब तक कि यह कंप्यूटर की मेमोरी को भर नहीं देता, जिससे सिस्टम क्रैश हो जाता है या धीमा होकर रुक जाता है।

"IndexMem" नामक शोध पत्र इस समस्या के समाधान के लिए एक चतुर दो-भागों वाले समाधान का प्रस्ताव करता है, जो एक स्मार्ट लाइब्रेरियन (पुस्तकालयाध्यक्ष) और एक बैकअप वॉल्ट (तिजोरी) की तरह कार्य करता है।

समस्या: "सब कुछ रखने" का जाल

वर्तमान में, अधिकांश AI मॉडल उनके द्वारा प्रोसेस किए गए प्रत्येक शब्द (टोकन) का रिकॉर्ड रखने की कोशिश करते हैं। यह आपके द्वारा अब तक देखी गई हर दुकान से प्राप्त प्रत्येक रसीद को अपने बटुए में रखने जैसा है। अंततः, बटुआ ले जाने के लिए बहुत भारी हो जाएगा।

इसे ठीक करने के लिए, पिछले तरीकों ने सरल नियमों के आधार पर "अमहत्वपूर्ण" रसीदों को फेंकने की कोशिश की, जैसे कि "सबसे हालिया रसीदों को रखें" या "सबसे बड़ी संख्या वाली रसीदों को रखें।" लेकिन ये नियम अक्सर अनाड़ी होते हैं। वे कहानी के शुरू में मौजूद किसी महत्वपूर्ण विवरण को केवल इसलिए फेंक सकते हैं क्योंकि वह पुराना था, या वे किसी उबाऊ वाक्य को रख सकते हैं क्योंकि वह हालिया था। एक बार फेंक दिए जाने के बाद, वह जानकारी हमेशा के लिए चली जाती है।

समाधान: IndexMem

लेखक एक प्रणाली का प्रस्ताव करते हैं जिसमें दो मुख्य भाग हैं: एक स्मार्ट इंडेक्सर (Smart Indexer) और एक लेटेंट मेमोरी वॉल्ट (Latent Memory Vault)

1. स्मार्ट इंडेक्सर (द "लाइब्रेरियन")

एक कठोर नियम का उपयोग करने के बजाय कि क्या रखना है, IndexMem एक लर्नेबल इंडेक्सर (सीखने योग्य इंडेक्सर) का उपयोग करता है। इसे एक अत्यधिक प्रशिक्षित लाइब्रेरियन के रूप में सोचें जिसने लाखों किताबें पढ़ी हैं और जानता है कि बाद में प्रश्नों के उत्तर देने के लिए किस प्रकार के विवरण आमतौर पर महत्वपूर्ण होते हैं।

  • यह कैसे काम करता है: जैसे-जैसे AI पढ़ता है, यह लाइब्रेरियन वर्तमान प्रश्न (या अगला शब्द जिसे AI अनुमान लगाने वाला है) को देखता है और भविष्यवाणी करता है कि टेक्स्ट के कौन से हिस्से वास्तव में महत्वपूर्ण हैं।
  • लाभ: यह केवल "हालियापन" के आधार पर अनुमान नहीं लगाता। यह संदर्भ (Context) को समझता है। यह कह सकता है, "भले ही यह शब्द पृष्ठ 50 से है, लेकिन यह पृष्ठ 100 के प्रश्न के लिए महत्वपूर्ण है, इसलिए हमें इसे रखना चाहिए।" यह तय करने में बहुत अधिक सटीक होने के लिए सीखता है कि मुख्य मेमोरी में क्या रहेगा और किसे बाहर निकाला जाएगा।

2. लेटेंट मेमोरी वॉल्ट (द "बैकअप वॉल्ट")

यही इस शोध पत्र का सबसे अभिनव विचार है। अतीत में, यदि कोई शब्द मुख्य मेमोरी से बाहर निकाल दिया जाता था, तो वह हमेशा के लिए चला जाता था। यदि AI को बाद में उस शब्द की आवश्यकता होती, तो यह एक आपदा होती।

IndexMem एक लेटेंट मेमोरी (Latent Memory) मॉड्यूल पेश करता है। इसे एक उच्च-तकनीकी, संपीड़ित (Compressed) बैकअप तिजोरी के रूप में सोचें।

  • प्रक्रिया: जब स्मार्ट इंडेक्सर यह तय करता है कि एक शब्द को मुख्य मेमोरी से बाहर निकाल दिया जाए, तो वह उसे केवल हटा नहीं देता। इसके बजाय, वह उस जानकारी को एक छोटे, संपीड़ित "सारांश" में सिकोड़ देता है और इसे इस विशेष तिजोरी में संग्रहीत करता है।
  • पुनर्प्राप्ति (Retrieval): यदि AI को बाद में उस जानकारी को याद करने की आवश्यकता होती है, तो वह मुख्य मेमोरी (जो खाली है) में वापस नहीं जाता है। इसके बजाय, वह तिजोरी खोलता है, संपीड़ित सारांश निकालता है, और इसका उपयोग कमियों को भरने के लिए करता है।
  • उपमा: कल्पना कीजिए कि आप एक यात्रा के लिए पैकिंग कर रहे हैं। आप अपने सूटकेस में केवल कुछ कपड़े ही रख सकते हैं (मुख्य मेमोरी)। आप अपना पसंदीदा स्वेटर पीछे छोड़ देते हैं। उसे फेंकने के बजाय, आप उसकी एक हाई-रिज़ॉल्यूशन फोटो लेते हैं और उसे अपने फोन में सेव कर लेते (लेटेंट मेमोरी)। यदि आपको बाद में उस स्वेटर की आवश्यकता होती है, तो आप यह याद करने के लिए कि वह कैसा दिखता था और कैसा महसूस होता था, उसकी फोटो देखते हैं, बजाय इसके कि आप पूरे स्वेटर को अपने साथ ढोएं।

यह क्यों मायने रखता है

शोध पत्र ने विभिन्न मॉडलों (जैसे Qwen, Mistral, और Llama) पर बहुत लंबे संदर्भों के साथ इस प्रणाली का परीक्षण किया।

  • बेहतर सटीकता: भले ही उन्होंने स्पेस बचाने के लिए मेमोरी का 75% से 90% तक आक्रामक रूप से हटाया हो, फिर भी AI अविश्वसनीय रूप से अच्छा प्रदर्शन करता रहा। यह "घास के ढेर में सुई" (किसी प्रश्न का उत्तर देने के लिए आवश्यक विशिष्ट विवरण) को नहीं भूलता है।
  • स्थिरता: पुराने तरीकों के विपरीत, जो किसी महत्वपूर्ण विवरण के "कठिन" स्थान पर होने पर अचानक विफल हो जाते थे, IndexMem स्थिर बना रहा।
  • दक्षता (Efficiency): इसने AI को मानक कंप्यूटर चिप्स पर चलने की अनुमति दी जिसके लिए भारी, महंगे सुपरकंप्यूटर की आवश्यकता नहीं थी, क्योंकि यह डेटा के हर एक टुकड़े को जमा करने की कोशिश नहीं कर रहा था।

सारांश

संक्षेप में, IndexMem AI को एक बेहतर संपादक बनना सिखाता है। यह यह तय करने के लिए एक सीखे हुए सिस्टम का उपयोग करता है कि अपनी तत्काल मेमोरी में क्या रखना है और बाकी को स्टोर करने के लिए एक विशेष "संपीड़ित तिजोरी" का उपयोग करता है। इस तरह, AI बिना अपनी मानसिक शक्ति समाप्त किए एक पूरी लाइब्रेरी पढ़ सकता है, और वह वास्तव में उन विवरणों को कभी नहीं भूलता जिनकी उसे किसी समस्या को हल करने के लिए आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →