MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference
MemDecay एक प्रशिक्षण-मुक्त (training-free), क्षेत्र-जागरूक (region-aware) KV कैश इविक्शन पॉलिसी है जो LLM एजेंट संदर्भों की सिमेंटिक संरचना का लाभ उठाकर विभिन्न टोकन क्षेत्रों को विशिष्ट प्रतिधारण प्राथमिकताएं (retention priorities) और क्षय दरें (decay rates) आवंटित करती है, जो महत्वपूर्ण जानकारी को संरक्षित करने और मेमोरी बाधाओं के तहत इन्फरेंस सटीकता बनाए रखने में मौजूदा रिसेंसी- या अटेंशन-आधारित बेसलाइनों की तुलना में काफी बेहतर प्रदर्शन करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट सहायक (एक LLM एजेंट) चला रहे हैं जो एक विशाल, बहु-चरणीय रहस्य को सुलझाने की कोशिश कर रहा है। इसे खेल के नियमों, मिलने वाले सुरागों, उपयोग किए जाने वाले उपकरणों और अपने स्वयं के बिखरे हुए स्क्रैचपैड नोट्स को याद रखना होगा। जैसे-जैसे रहस्य लंबा होता जाता है, रोबोट का "दिमाग" (उसका मेमोरी कैश) ओवरफ्लो होने लगता है। यदि यह जगह खाली नहीं करता है, तो यह क्रैश हो जाएगा या धीमा हो जाएगा।
बड़ी समस्या यह है कि अधिकांश रोबोट स्मृति के हर टुकड़े के साथ एक जैसा व्यवहार करते हैं। वे कह सकते हैं, "ओह, मैंने काफी समय से इस सुराग को नहीं देखा है, इसलिए मैं इसे बाहर फेंक दूँगा," या "यह आखिरी चीज़ थी जो मैंने अभी पढ़ी है, इसलिए मैं इसे रखूँगा।" लेकिन यह एक नक्शा फेंक देने जैसा है क्योंकि आपने कल उसे देखा था, जबकि एक रैंडम डूडल को रखना जिसे आपने अभी बनाया है।
यहाँ MemDecay आता है, जो एक रणनीति है जो रोबोट के दिमाग के लिए एक स्मार्ट, व्यवस्थित लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह काम करती है। यहाँ बताया गया है कि यह कैसे काम करता है, इसने क्या पाया, और इसने क्या बिल्कुल भी नहीं पाया।
स्मार्ट लाइब्रेरियन रणनीति
सभी स्मृतियों को समान मानने के बजाय, MemDecay रोबोट के मैनेजर से पूछता है: "यह किस प्रकार की स्मृति है?"
- क्या यह एक सिस्टम निर्देश (System Instruction) है? (रोबोट के मूल नियम, जैसे "हमेशा विनम्र रहें।")
- क्या यह एक योजना (Plan) है? (रहस्य को सुलझाने के चरण।)
- क्या यह स्क्रैचपैड (Scratchpad) है? (अस्थायी गणित या नोट्स जिन पर रोबोट अभी काम कर रहा है।)
- क्या यह टूल आउटपुट (Tool Output) है? (कैलकुलेटर या सर्च इंजन से प्राप्त डेटा।)
MemDecay प्रत्येक प्रकार की स्मृति को एक अलग "एक्सपायरी डेट" (समाप्ति तिथि) और एक अलग "महत्व स्कोर" देता है।
- सिस्टम निर्देशों (System Instructions) को "पिन्ड" (Pinned) बैज मिलता है। वे शेल्फ से चिपके रहते हैं और कभी भी फेंके नहीं जाते, चाहे लाइब्रेरी कितनी भी भर जाए।
- स्क्रैचपैड नोट्स (Scratchpad notes) का शेल्फ-लाइफ बहुत छोटा होता है। यदि रोबोट कुछ सेकंड के लिए उनका उपयोग करना बंद कर देता है, तो वे गायब हो जाते हैं।
- योजनाएं (Plans) और टूल्स (Tools) को मध्यम शेल्फ-लाइफ मिलता है, लेकिन यदि रोबोट उन्हें फिर से देखता है, तो उनकी "एक्सपायरी घड़ी" रीसेट हो जाती है, जिससे वे सुरक्षित रहते हैं।
यह सिस्टम प्रत्येक मेमोरी टोकन के लिए एक स्कोर की गणना करता है जो उसके प्रकार और हाल ही में उपयोग किए जाने के आधार पर होता है। जब लाइब्रेरी भर जाती है, तो यह उन पेजों को बाहर निकाल देता है जिनका स्कोर सबसे कम होता है।
प्रयोगों ने वास्तव में क्या दिखाया
शोधकर्ताओं ने दो रोबोट आकारों (1.5 बिलियन और 3 बिलियन पैरामीटर्स) और दो मेमोरी आकारों (लगभग 450 टोकन और 1,700 टोकन) पर इसका परीक्षण किया। उन्होंने विभिन्न हिस्सों में विशिष्ट तथ्य रोबोट की स्मृति में बोए और फिर रोबोट को अपनी स्मृति का आधा हिस्सा हटाने के लिए मजबूर करने के बाद उनसे उन तथ्यों को याद करने के लिए कहा।
1. "पिन्ड" (Pinned) की जीत
सबसे बड़ी जीत "सिस्टम" निर्देशों की रही। जब मेमोरी को उसके आकार के 25% या 50% तक सिकोड़ा गया, तो MemDecay ने सिस्टम नियमों को हर बार सुरक्षित रखा (छोटे परीक्षण में 24 में से 24 बार, लंबे परीक्षण में 24 में से 21 बार)।
- विपरीत स्थिति: अन्य तरीके जो केवल "सबसे हालिया" स्मृतियों को रखते हैं (जैसे कि एक रोबोट जो केवल पिछली कुछ पंक्तियों को याद रखता है), पूरी तरह से विफल रहे। लंबे परीक्षणों पर, वे सिस्टम निर्देशों को लगभग शून्य याद रख पाए। "हालिया-मात्र" (recent-only) दृष्टिकोण जैसे-जैसे कहानी लंबी होती जाती है, पूरी तरह से ध्वस्त हो जाता है।
2. "स्क्रैचपैड" की वास्तविकता
प्रयोगों ने मापा कि विभिन्न स्मृतियाँ वास्तव में कितनी देर तक उपयोगी रहीं।
- सिस्टम निर्देश लंबे समय तक रहे: लगभग 148 से 189 डिकोड स्टेप्स (वह समय जो रोबोट को उतने शब्द उत्पन्न करने में लगता है)।
- स्क्रैचपैड नोट्स अविश्वसनीय रूप से तेज़ी से गायब हो गए: केवल 14 से 16 स्टेप्स।
- प्राप्त दस्तावेज़ (Retrieved documents) (जैसे खोज परिणाम) आश्चर्यजनक रूप से लंबे समय तक जीवित रहे, भले ही शोधकर्ताओं को शुरू में लगा था कि वे टूल आउटपुट या यूजर मैसेज की तुलना में जल्दी गायब हो जाएंगे।
3. "पुराना तथ्य" की समस्या (हानि)
यहाँ MemDecay लड़खड़ा गया। जब रोबोट को किसी पुराने यूजर मैसेज या बातचीत की शुरुआत के किसी तथ्य को याद करना था जो पिन्ड नहीं था, तो MemDecay अक्सर विफल रहा।
- छोटे परीक्षण में, इसने पुराने यूजर तथ्यों में से 0 में से 24 को याद किया।
- लंबे परीक्षण में, इसने 24 में से केवल 5 से 7 को याद किया।
- इस बीच, एक प्रतिस्पर्धी तरीका जो केवल "सबसे अधिक अटेंड-टू" (most attended-to) टोकन को रखता है (जिसे H2O-स्टाइल कहा जाता है), वह बहुत बेहतर प्रदर्शन कर गया, जिसने इनमें से 11 से 20 को याद किया।
क्यों हुआ यह फेल? पेपर बताता है कि रोबोट के अटेंशन (ध्यान) से मिलने वाला "महत्व" स्कोर उन पुराने तथ्यों को बचाने के लिए बहुत कमजोर था। "डिके" (क्षय/decay - एक्सपायरी क्लॉक) उन अनपिन्ड आइटम्स के लिए बहुत तेज़ी से चल रहा था, जिससे अटेंशन सिग्नल भी घड़ी को रोक नहीं सका। शोधकर्ता सुझाव देते हैं कि केवल अटेंशन सिग्नल की आवाज़ (volume) बढ़ाना ही काफी नहीं है; गणित को एडजस्ट करने की आवश्यकता है ताकि अटेंशन सिग्नल डिके के साथ प्रतिस्पर्धा करने के लिए पर्याप्त मजबूत हो सके।
MemDecay क्या नहीं है
यह जानना महत्वपूर्ण है कि यह पेपर क्या दावा नहीं करता है:
- यह हर चीज़ के लिए जादुई समाधान नहीं है। इसने स्पष्ट रूप से इस विचार को खारिज कर दिया कि "रिसेंसी" (नई चीजों को रखना) लंबे एजेंट कार्यों के लिए काम करती है। डेटा दिखाता है कि "अभी क्या कहा गया" पर निर्भर रहना जैसे-जैसे बातचीत बढ़ती है, बुरी तरह विफल हो जाता है।
- यह पुराने तथ्यों के लिए रिकॉल की समस्या को हल करने वाला कोई "ब्रेकथrugh" नहीं है। पेपर स्वीकार करता है कि अनपिन्ड, पुराने तथ्यों के लिए, MemDecay ने इन विशिष्ट परीक्षणों में मौजूदा अटेंशन-आधारित तरीकों की तुलना में वास्तव में खराब प्रदर्शन किया।
- यह नए वेट्स (weights) को "सीखता" नहीं है। यह "ट्रेनिंग-फ्री" है, जिसका अर्थ है कि यह रोबोट के दिमाग को फिर से प्रशिक्षित नहीं करता है। यह बस नियमों के एक स्मार्ट सेट और माप के थोड़े से उपयोग से एक्सपायरी क्लॉक्स को ट्यून करता है।
निचोड़ (The Bottom Line)
MemDecay एक चतुर, नियम-आधारित प्रणाली है जो रोबोट की स्मृति को केवल आयु के बजाय प्रकार के आधार पर व्यवस्थित करती है।
- यह रोबोट के मुख्य नियमों और निर्देशों की रक्षा करने में बड़ी जीत हासिल करता है, यह सुनिश्चित करता है कि जब मेमोरी कम हो तब भी वे कभी खो न जाएं।
- यह पुराने, अनपिन्ड तथ्यों को याद करने में हार जाता है, जहाँ यह केवल अटेंशन का पालन करने वाले तरीकों से पीछे रह जाता है।
शोधकर्ताओं ने हजारों टेस्ट केस में इन परिणामों को मापा और पाया कि जबकि "टाइप-बेस्ड" दृष्टिकोण संरचना के लिए महान है, इसे पुराने, उपयोगी चीजों को भूलने से रोकने के लिए गणितीय सुधार की आवश्यकता है। यह लंबे समय तक चलने वाले रोबोट एजेंटों को अधिक विश्वसनीय बनाने की दिशा में एक ठोस कदम है, लेकिन काम अभी पूरा नहीं हुआ है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।