← नवीनतम पेपर
🤖 AI

AgentKVShift: Efficient KV Cache Reuse for Agentic Memory Systems

AgentKVShift एक प्रशिक्षण-मुक्त (training-free), प्रोब-गाइडेड विधि है जो केवल 10-30% टोकन पुनर्गणना के साथ KV कैशों के कुशल पुन: उपयोग और सुधार द्वारा एजेंटिक मेमोरी सिस्टम को महत्वपूर्ण रूप से तेज करती है, जिससे विभिन्न LLMs और बेंचमार्क में पूर्ण पुनर्गणना प्रदर्शन के करीब और 2-3.5x प्रीफिल स्पीडअप प्राप्त होता है।

मूल लेखक: Nilesh Prasad Pandey, Jason Kong, Lanxiang Hu, Quanling Zhao, Yujie Zhao, Onat Gungor, Hao Zhang, Tajana Rosing

प्रकाशित 2026-07-27
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nilesh Prasad Pandey, Jason Kong, Lanxiang Hu, Quanling Zhao, Yujie Zhao, Onat Gungor, Hao Zhang, Tajana Rosing

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोटिक सहायक हैं, एक डिजिटल बटलर की तरह जो आपकी हर कही हुई बात को याद रखता है। आप महीनों से उससे बातें कर रहे हैं, अपनी पसंदीदा फिल्मों, अपने होमवर्क के संघर्षों और भविष्य के अपने सपनों के बारे में चर्चा कर रहे हैं। एक नए प्रश्न का उत्तर देने के लिए, इस रोबोट को अपने पिछले संवादों की विशाल डायरी को पीछे देखना होगा। लेकिन यहाँ एक पेच है: हर बार जब वह अपने पुराने नोट्स पढ़ने के लिए एक नया पन्ना पलटता है, तो उसे हर शब्द को शुरू से फिर से पढ़ना पड़ता है, अपने मस्तिष्क में प्रत्येक वाक्य के अर्थ की पुन: गणना करनी पड़ती है। यह अविश्वसनीय रूप से धीमा है और बहुत अधिक ऊर्जा का उपयोग करता है, जैसे एक केक का केवल एक टुकड़ा चखने के लिए पूरा केक फिर से बनाना।

आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस "पुनः पढ़ने" की प्रक्रिया को की-वैल्यू (KV) स्टेट्स (Key-Value States) जेनरेट करना कहा जाता है। इन स्टेट्स को उन शब्दों की आंतरिक "समझ" के रूप में समझें जिन्हें रोबोट ने अभी पढ़ा है। आमतौर पर, यदि रोबोट उन्हीं शब्दों को फिर से देखता है, तो वह अपने पुराने नोट्स (जिसे KV कैश कहा जाता है) का उपयोग कर सकता है बजाय इसके कि वह सब कुछ फिर से पढ़े। हालाँकि, एक लंबी बातचीत में, संदर्भ (context) बदल जाता है। "बैंक" शब्द का अर्थ तब अलग होता है जब आप पैसे के बारे में बात कर रहे हों बनाम जब आप एक नदी के बारे में बात कर रहे हों। क्योंकि अर्थ बदल जाता है, रोबोट के पुराने नोट्स थोड़े "पुराने या गलत" (stale) हो जाते हैं। यदि वह उन पुराने नोट्स का उपयोग करता है, तो वह अजीब या गलत उत्तर दे सकता है। इसलिए, रोबोट के पास एक विकल्प है: सब कुछ फिर से पढ़ना (धीमा और महंगा) या पुराने नोट्स का उपयोग करना और उम्मीद करना कि वे पर्याप्त रूप से सटीक होंगे (तेज़, लेकिन जोखिम भरा)।

पुराने तरीके के साथ समस्या
वैज्ञानिकों ने इसे ठीक करने के लिए चयनात्मक होने की कोशिश की है। उन्होंने पाया कि पूरे पन्ने को फिर से पढ़ने के बजाय, रोबोट केवल कुछ "महत्वपूर्ण" शब्दों (टोकन्स) को फिर से पढ़ सकता है और बाकी का अनुमान लगा सकता है। यह एक पैराग्राफ के पहले और अंतिम वाक्य को पढ़ने और बीच के हिस्से का अनुमान लगाने जैसा है। यह समाचार लेख जैसे सरल कार्यों के लिए ठीक काम करता है। लेकिन जब रोबोट एक जटिल एजेंट के रूप में कार्य कर रहा हो—जैसे शेड्यूल प्रबंधित करना, कोड लिखना, या एक गहरी, बहु-दिवसीय बातचीत करना—तो यह "बीच का अनुमान लगाने" वाली रणनीति विफल हो जाती है। रोबोट के पुराने नोट्स इतने विकृत हो जाते हैं कि अनुमान खराब हो जाते हैं, और उत्तरों की गुणवत्ता गिर जाती है। पुराने तरीके कच्चे टेक्स्ट (raw text) के लिए डिज़ाइन किए गए थे, लेकिन आधुनिक एजेंट "क्यूरेटेड" (curated) यादों का उपयोग करते हैं: सारांश, टैग और कीवर्ड जो रोबोट ने स्वयं बनाए हैं। ये संरचित नोट्स जटिल होते; पुराने "चयनात्मक पुनः पठन" वाले तरीके उन पर काम नहीं करते।

नया समाधान: AgentKVShift
यहाँ AgentKVShift आता है, जो रोबोट की याददाश्त के लिए एक चतुर संपादक की तरह कार्य करता है। शोधकर्ताओं ने कुछ दिलचस्प खोजा कि ये "पुराने या गलत" (stale) नोट्स कैसे गलत होते हैं। उन्होंने पाया कि त्रुटि कोई यादृच्छिक अराजकता (random chaos) नहीं है; यह मुख्य रूप से एक साझा "ड्रिफ्ट" (drift) है जो मेमोरी के पूरे हिस्से को प्रभावित करता है, साथ ही प्रत्येक शब्द के लिए छोटे-छोटे व्यक्तिगत उतार-चढ़ाव भी होते हैं।

कल्पना कीजिए कि आपके पास पुरानी तस्वीरों का एक ढेर है जो धूप में रहने के कारण थोड़ी फीकी पड़ गई हैं। पुराना तरीका इन तस्वीरों को ठीक करने के लिए कुछ चुनिंदा तस्वीरों को फिर से विकसित करने की कोशिश करेगा, और बाकी को फीका ही छोड़ देगा। AgentKVShift कुछ स्मार्ट करता है। यह तस्वीरों का एक छोटा "प्रोब" सेट (केवल कुछ शब्द) चुनता है और उन्हें फिर से विकसित करता है ताकि यह देख सके कि धूप ने पूरे ढेर को कितना फीका किया है। फिर, यह उस मापे गए "ड्रिफ्ट" को उस पूरे ढेर के हर एक फोटो पर लागू करता है, न कि केवल उन चुनिated तस्वीरों पर जिन्हें इसने फिर से विकसित किया था।

यह व्यवहार में कैसे काम करता है
इस जादुई प्रक्रिया के चरण यहाँ दिए गए हैं:

  1. द प्रोब (The Probe): जब रोबोट को मेमोरी के एक हिस्से की आवश्यकता होती है, तो वह शब्दों के एक छोटे नमूने (कुल का लगभग 10% से 30%) के लिए अर्थ की पुन: गणना करता है।
  2. द शिफ्ट (The Shift): यह इन नमूना शब्दों के लिए ताज़ा गणना और पुराने, 'स्टेल' नोट के बीच के अंतर को मापता है। यह अंतर "ऑफसेट" (offset) या "ड्रिफ्ट" (drift) है।
  3. द करेक्शन (The Correction): अन्य 70-90% शब्दों को वैसा ही छोड़ने के बजाय, AgentKVShift उस मापे गए "ड्रिफ्ट" को लेता है और मेमोरी के प्रत्येक शब्द में एक सूक्ष्म सुधार जोड़ देता है। यह ऐसा ही है जैसे कहना, "पूरा ढेर 5% पीला है, तो चलिए हर फोटो में थोड़ा नीला रंग मिला देते हैं ताकि उसे ठीक किया जा सके।"

परिणाम
परिणाम प्रभावशाली हैं। चार अलग-अलग AI मॉडल (3-बिलियन पैरामीटर वाले छोटे मॉडल से लेकर 32-बिलियन पैरामीटर वाले बड़े मॉडल तक) का उपयोग करके किए गए परीक्षणों में, AgentKVShift ने ऐसे उत्तर प्राप्त किए जो लगभग उतने ही अच्छे थे जितने कि तब होते जब रोबोट सब कुछ शुरू से फिर से पढ़ता।

  • गति: इसने यह सब केवल 10% से 30% डेटा की पुन: गणना करके हासिल किया। इसने रोबोट को बिना किसी कैशिंग के काम करने की तुलना में अपने जवाब शुरू करने में 2 से 3.5 गुना तेज़ बना दिया।
  • दक्षता (Efficiency): इसने वही उच्च-गुणवत्ता वाले परिणाम प्राप्त किए जो अन्य तरीके केवल तब प्राप्त कर पाते थे जब वे लगभग आधे (45-55%) डेटा की पुन: गणना करते।
  • मजबूती (Robustness): यहाँ तक कि जब रोबोट की मेमोरी को जगह बचाने के लिए संकुचित (compress) किया गया (आक्रामक 2-बिट या 4-बिट सेटिंग्स का उपयोग करके), AgentKVShift अच्छी तरह से काम करता रहा, और पिछले तरीकों की तुलना में दोगुनी से अधिक सटीकता बनाए रखी।

यह क्या नहीं करता
यह ध्यान रखना महत्वपूर्ण है कि यह विधि क्या नहीं करती है। इसे रोबोट को नए डेटा के साथ फिर से प्रशिक्षित (re-trained) करने की आवश्यकता नहीं है; यह मौजूदा मॉडलों के साथ काम करता है। यह भी लंबे समय की स्मृति (long-term memory) की हर समस्या को हल नहीं करता है। जबकि यह विशिष्ट मेमोरी चंक्स को पुनः प्राप्त करने के लिए "स्टेल नोट्स" की समस्या को ठीक करता है, यह रोबंब की कई अलग-अलग मेमोरी चंक्स के बीच तर्क करने की क्षमता को जादू से ठीक नहीं करता है यदि तर्क के लिए गहरे, क्रॉस-चंक थिंकिंग की आवश्यकता हो। उन जटिल तर्क कार्यों के लिए, इस विधि और सब कुछ फिर से पढ़ने के बीच का अंतर अभी भी मौजूद है, हालांकि AgentKVShift उपलब्ध सबसे अच्छा विकल्प बना हुआ है।

यह क्यों महत्वपूर्ण है
जो कोई भी ऐसे AI असिस्टेंट बना रहा है जिन्हें लंबी बातचीत को याद रखने या हफ्तों तक जटिल कार्यों को प्रबंधित करने की आवश्यकता है, उनके लिए AgentKVShift एक सरल और शक्तिशाली उपकरण है। यह एक "रिफ्रेश बजट" (उन शब्दों की सीमित संख्या जिन्हें आप फिर से पढ़ सकते हैं) को पूरे मेमोरी चंक के लिए एक उपयोगी संकेत में बदल देता है। यह महसूस करके कि मेमोरी की त्रुटियां अक्सर एक साथ बदलती हैं, शोधकर्ताओं ने एक धीमी, महंगी समस्या को एक तेज़, कुशल समाधान में बदल दिया, जिससे लंबी अवधि की AI मेमोरी व्यावहारिक और तेज़ हो गई।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →