← नवीनतम पेपर
🤖 machine learning

IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference

IntentKV एक सीखा हुआ, क्रॉस-टर्न इंटेंट-अवेयर (intent-aware) KV कैश प्रूनिंग मेथड है जो एक फ्रोजन बेस LLM को बनाए रखते हुए सेशन-लेवल मेमोरी और एक ज़ीरो-इनिशियलाइज़्ड रेसिडुअल हेड का उपयोग करके टोकन को डायनेमिक रूप से स्कोर और रीडायरेक्ट करता है, जिससे न्यूनतम सटीकता हानि के साथ लॉन्ग-होरिज़न एजेंट इन्फरेंस के लिए पीक मेमोरी और KV रीड बैंडविड्थ में महत्वपूर्ण कमी आती है।

मूल लेखक: Junjie Li, Jiong Lou, Jie Li

प्रकाशित 2026-06-10
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junjie Li, Jiong Lou, Jie Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यधिक कुशल जासूस (AI एजेंट) हैं जो एक जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं। आप केवल एक प्रश्न पूछकर उत्तर प्राप्त नहीं करते; आपको एक लंबी यात्रा पर निकलना पड़ता है। आप पुस्तकालय की खोज करते हैं, गवाहों का साक्षात्कार लेते हैं, पुरानी फाइलों की जांच करते हैं, और नोट्स लिखते हैं। प्रत्येक चरण आपके डेस्क पर कागजों की संख्या बढ़ाता जाता है।

अंततः, आपका डेस्क कागजों से इतना भर जाता है कि आप कुछ भी ढूंढ नहीं पाते और आपके पास नए नोट्स लिखने के लिए जगह भी खत्म हो जाती है। यह बिल्कुल वही समस्या है जिसे IntentKV AI एजेंटों के लिए हल करता है।

यहाँ सरल उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है:

समस्या: "बिखरा हुआ डेस्क" (The Cluttered Desk)

जब एक AI एजेंट एक बहु-चरणीय कार्य (जैसे उड़ान खोजने और फिर उसे बुक करने) पर काम करता है, तो वह सूचनाओं का एक विशाल निशान बनाता है:

  1. उपयोगकर्ता का अनुरोध: "मेरे लिए एक फ्लाइट ढूंढो।"
  2. खोज: AI उड़ानें खोजता है।
  3. परिणाम: यह 50 उड़ानों की सूची पढ़ता है।
  4. फॉलो-अप: "सबसे सस्ती कौन सी है?"
  5. नई खोज: यह फिर से खोज करता है।

हर बार जब AI सोचता है, तो उसे संदर्भ समझने के लिए अपने डेस्क पर मौजूद सभी पिछले कागजों को देखना पड़ता है। जैसे-जैसे बातचीत लंबी होती जाती है, "डेस्क" (मेमोरी) बहुत बड़ा हो जाता है। पेपर का तर्क है कि सबसे बड़ी बाधा AI की दिमागी शक्ति (कंप्यूटिंग पावर) नहीं है; बल्कि उस डेस्क को याद रखने की मेमोरी स्पेस और उसे पढ़ने की गति है। यदि डेस्क बहुत भर जाता है, तो AI धीमा हो जाता है या क्रैश हो जाता है।

पुराने समाधान: "कागजों को इधर-उधर करना" (Shuffling the Papers)

पिछले तरीकों ने पुराने कागजों को फेंककर इस समस्या को ठीक करने की कोशिश की।

  • समस्या: वे आमतौर पर वर्तमान प्रश्न को देखते थे और तय करते थे कि क्या फेंकना है।
  • दोष: एक लंबे जासूसी उपन्यास में, पेज 1 का सुराग पेज 50 पर महत्वपूर्ण हो सकता है। पुराने तरीकों ने अक्सर उस पेज 1 के सुराग को इसलिए फेंक दिया क्योंकि वह अभी महत्वपूर्ण नहीं लग रहा था।
  • दूसरा दोष: कुछ तरीकों ने बचे हुए कागजों को एक नए, छोटे ढेर में भौतिक रूप से स्थानांतरित (move) कर दिया। इससे वह "इंडेक्स" या "मैप" टूट गया जिसका उपयोग सिस्टम विभिन्न उपयोगकर्ताओं के बीच साझा जानकारी को जल्दी से खोजने के लिए करता है। यह एक लाइब्रेरी को पुनर्गठित करने जैसा है जहाँ "हैरी पॉटर" अब पहले वाली शेल्फ के बजाय किसी दूसरी शेल्फ पर है; लाइब्रेरियन (सिस्टम) भ्रमित हो जाता है और किताबों का कुशलतापूर्वक पुन: उपयोग नहीं कर पाता है।

नया समाधान: IntentKV

लेखकों ने IntentKV बनाया है, जो एक स्मार्ट, व्यवस्थित सहायक की तरह काम करता है जो किताबों को हिलाए बिना डेस्क का प्रबंधन करता है।

1. "सेशन मेमोरी" (जासूस की नोटबुक)

केवल वर्तमान प्रश्न को देखने के बजाय, IntentKV पूरे जांच का एक निरंतर सारांश रखता है।

  • यह कैसे काम करता है: यह एक "QueryMemory" बनाए रखता है जो बातचीत के साथ अपडेट होती रहती है। इसे पता होता है कि भले ही उपयोगकर्ता वर्तमान में "कीमतों" के बारेारे में पूछ रहा हो, उन्हें निर्णय लेने के लिए 10 मिनट पहले के "फ्लाइट शेड्यूल" की आवश्यकता हो सकती है।
  • उपमा: कल्पना कीजिए कि एक जासूस दीवार पर एक स्टिकी नोट रखता है जिसमें लिखा है, "याद रखें: संदिग्ध ने लाल टोपी पहनी थी।" भले ही वर्तमान बातचीत मौसम के बारे में हो, जासूस जानता है कि लाल टोपी अभी भी प्रासंगिक है। IntentKV "लाल टोपी" वाले कागजों को डेस्क पर रखता है, भले ही इस समय उन्हें देखा न जा रहा हो।

2. "ज़ीरो-इनिट रेसिडुअल" (सुरक्षा जाल - The Safety Net)

सिस्टम यह तय करने के लिए एक सरल नियम का उपयोग करता है कि क्या रखना है (सेशन मेमोरी के आधार पर)। लेकिन कभी-कभी, नियम कुछ सूक्ष्म चीजों को मिस कर देता है।

  • समाधान: उन्होंने एक छोटा, सीखने योग्य "रेसिडुअल हेड" जोड़ा है। इसे एक जूनियर इंटर्न की तरह समझें जो सीनियर जासूस की सूची की दोबारा जांच करता है।
  • जादू: यह इंटर्न शून्य ज्ञान (zero-initialized) के साथ शुरू होता है और केवल सीनियर की गलतियों को सुधारने के लिए सीखता है। यह डिटेक्टिव के दिमाग (मुख्य AI मॉडल) को नहीं बदलता है; यह बस एक छोटा सा स्मार्ट सुधार जोड़ता है।

3. "डेड स्लॉट" ट्रिक (जादुई मानचित्र - The Magic Map)

यह सबसे चतुर हिस्सा है। जब डेस्क भर जाता है, तो IntentKV को कुछ कागज हटाने पड़ते हैं।

  • पुराना तरीका: कागज निकाल लें, शेष कागजों को कसकर एक के ऊपर एक रखें, और उन्हें फिर से नंबर दें। (यह लाइब्रेरी के इंडेक्स को तोड़ देता है)।
  • IntentKV का तरीका: यह कागज को निकाल लेता है, लेकिन अन्य कागजों को हिलाए बिना, खाली जगह पर एक "पढ़ना मना है" का साइन (सेंटिनल डेड स्लॉट) लगा देता है।
  • परिणाम: कागज बिल्कुल वहीं रहते हैं जहाँ वे थे। डेस्क का "मैप" एकदम सही रहता है। यदि कोई दूसरा जासूस समान मामले के साथ आता है, तो सिस्टम तुरंत साझा कागजों को पहचान सकता है क्योंकि वे हिले नहीं हैं। यह सिस्टम को मेमोरी कुशलतापूर्वक पुन: उपयोग करने की अनुमति देता है, जिससे बहुत समय और स्थान बचता है।

परिणाम: उन्हें क्या मिला?

पेपर का परीक्षण दो विशिष्ट AI मॉडल्स (Qwen3-8B और Qwen2.5-14B) पर एक कठिन "डीप रिसर्च" बेंचमार्क BrowseComp-Plus का उपयोग करके किया गया।

  • सटीकता (Accuracy): IntentKV ने AI को उतना ही स्मार्ट बनाए रखा जितना कि अनंत मेमोरी होने पर होता। इसने अपनी "जासूसी क्षमता" नहीं खोई।
  • दक्षता (Efficiency):
    • इसने मानक कार्यों के लिए आवश्यक मेमोरी को लगभग 24% से 31% तक कम कर दिया।
    • सबसे कठिन, लंबे कार्यों के लिए, इसने मेमोरी उपयोग को 78% तक और पढ़ने की गति की आवश्यकताओं को 92% तक कम कर दिया।
  • तुलना: इसने सभी अन्य "सफाई करने वाले" (cleaning up) तरीकों को पछाड़ दिया। जबकि अन्य तरीके मेमोरी कम होने पर क्रैश हो गए या गलत उत्तर देने लगे, IntentKV सुचारू रूप से काम करता रहा।

महत्वपूर्ण सीमाएं (जो पेपर नहीं कहता)

  • यह सभी AI के लिए जादू की छड़ी नहीं है: पेपर नोट करता है कि उन्होंने केवल विशिष्ट "Qwen" मॉडल्स पर परीक्षण किया है। अन्य लोकप्रिय ओपन-सोर्स मॉडल (जैसे Llama या Mistral) अपने परीक्षणों में बहु-चरणीय कार्यों को सही ढंग से करने में भी विफल रहे, इसलिए IntentKV का उन पर परीक्षण नहीं किया जा सका। समस्या मेमोरी की नहीं थी; मॉडल उस विशिष्ट परीक्षण वातावरण में "एजेंट" की तरह कार्य ही नहीं कर पा रहे थे।
  • यह अपना बजट खुद नहीं चुनता: सिस्टम को एक निश्चित सीमा निर्धारित करने के लिए एक मानव की आवश्यकता होती है (जैसे, "8,000 टोकन रखें")। यह स्वचालित रूप से यह तय नहीं करता है कि, "ओह, यह प्रश्न छोटा है, मैं कम मेमोरी का उपयोग करूँगा।"
  • यह चैटबॉट्स के लिए नहीं, एजेंटों के लिए है: यह विशेष रूप से उन AI के लिए डिज़ाइन किया गया है जो कई चरणों (टर्न्स) में टूल्स (सर्च, कोड, आदि) का उपयोग करते हैं, न कि एक साधारण वन-ऑफ चैट के लिए।

सारांश

IntentKV AI एजेंटों के लिए एक स्मार्ट मेमोरी मैनेजर है। यह केवल वर्तमान वाक्य को नहीं, बल्कि पूरी बातचीत के इरादे (intent) को ट्रैक करके अतीत के सबसे महत्वपूर्ण सुरागों को सुरक्षित रखता है। यह पुराने सूचनाओं को हटाता है लेकिन शेष कागजों को इधर-उधर नहीं करता, जिससे AI लंबी और जटिल जांचों के दौरान भी तेज़, सटीक और कुशल बना रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →