← नवीनतम पेपर
💬 NLP

ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution

ForesightKV एक प्रशिक्षण-आधारित ढांचा है जो गोल्डन इविक्शन एल्गोरिदम को सुपरवाइज्ड लर्निंग और रिइन्फोर्समेंट लर्निंग (GRPO) के साथ जोड़कर रीजनिंग मॉडल्स के लिए KV कैश इविक्शन को अनुकूलित करता है ताकि सबसे महत्वपूर्ण KV पेयर्स का पूर्वानुमान लगाया जा सके और उन्हें बनाए रखा जा सके, जिससे लंबे रीजनिंग कार्यों पर उच्च प्रदर्शन बनाए रखते हुए मेमोरी लागत को काफी कम किया जा सके।

मूल लेखक: Zican Dong, Peiyu Liu, Junyi Li, Zhipeng Chen, Han Peng, Shuo Wang, Wayne Xin Zhao

प्रकाशित 2026-02-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zican Dong, Peiyu Liu, Junyi Li, Zhipeng Chen, Han Peng, Shuo Wang, Wayne Xin Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली जासूस (AI) हैं जो एक बहुत ही लंबे और जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं। इसे करने के लिए, आपको अपने डेस्क पर सुरागों की एक विशाल नोटबुक (KV Cache) रखनी होगी। जैसे-जैसे कहानी लंबी होती जाती है, आपकी नोटबुक मोटी और घनी होती जाती है। अंततः, आपका डेस्क कागजों से इतना भर जाता है कि आप अपने हाथ भी नहीं हिला पाते, और आपको अगला निष्कर्ष निकालने के लिए विशिष्ट सुराग खोजने में बहुत समय लगता है। यह "मेमोरी ओवरलोड" की समस्या है जो लार्ज लैंग्वेज मॉडल्स (LLMs) में देखी जाती है।

परंपरागत रूप से, डेस्क को साफ करने के लिए लोग सरल नियमों का उपयोग करते हैं: "सबसे पुराने कागजात फेंक दो" या "जिन कागजों पर सबसे कम स्याही है उन्हें फेंक दो।" लेकिन पेपर ForesightKV तर्क देता है कि ये नियम बहुत मूर्खतापूर्ण हैं। कभी-कभी, एक पुराना कागज या कम स्याही वाला कागज कहानी के आगे के हिस्से में रहस्य सुलझाने के लिए सबसे महत्वपूर्ण सुराग हो सकता है। उसे फेंक देने से जासूस गलती कर बैठता है, जिससे पूरी जांच खराब हो जाती है।

यहाँ बताया गया है कि ForesightKV इस समस्या को तीन सरल चरणों में कैसे हल करता है:

1. समस्या: "वन-पास" (One-Pass) की गलती

कल्पना कीजिए कि आप यात्रा के लिए पैकिंग कर रहे हैं। एक मानक तरीका कह सकता है, "पिछले 10 सामान जो आपने पैक किए थे उन्हें रखें, और बाकी को फेंक दें।" लेकिन क्या होगा अगर आपने जो पहला सामान पैक किया था (एक नक्शा) वह पूरी यात्रा के लिए आवश्यक है, भले ही वह सूटकेस में बहुत पीछे रखा हो?
मौजूदा तरीके यह अनुमान लगाने की कोशिश करते हैं कि किन सुरागों को रखना है, लेकिन वे सरल पैटर्न (जैसे "हालिया रखें" या "लोकप्रिय रखें") का उपयोग करते हैं। शोध में पाया गया कि जटिल तर्क (जैसे गणित की समस्याओं) में, सुरागों के तीन प्रकार के व्यक्तित्व होते हैं:

  • द ग्लोबल स्टार (The Global Star): हमेशा महत्वपूर्ण, चाहे कुछ भी हो।
  • द लोकल नेबर (The Local Neighbor): केवल थोड़े समय के लिए महत्वपूर्ण।
  • द सिमेंटिक कैमेलियन (The Semantic Chameleon): यह सबसे पेचीदा है। एक सुराग अभी बेकार लग सकता है, लेकिन 50 चरणों के बाद, वह पूरे पहेली की कुंजी बन सकता है। सरल नियम इन "कैमेलियन" को पहचानने में चूक जाते हैं।

2. समाधान: एक "समय-यात्रा करने वाला" कोच

लेखकों ने ForesightKV नामक एक नया सिस्टम बनाया है। एक कठोर नियम पुस्तिका के बजाय, उन्होंने एक छोटा, स्मार्ट सहायक (एक Scoring Model) प्रशिक्षित किया है जो एक ऐसे कोच की तरह काम करता है जो भविष्य देख सकता है।

यह कोच केवल वर्तमान के सुरागों को नहीं देखता; यह यह अनुमान लगाना सीखता है कि भविष्य में कौन से सुराग सबसे अधिक मायने रखेंगे। यह दो चरणों वाली प्रशिक्षण प्रक्रिया के माध्यम से ऐसा करता है:

चरण 1: "गोल्डन स्टैंडर्ड" (सुपरवाइज्ड लर्निंग)

सबसे पहले, शोधकर्ताओं ने AI को एक गणित की समस्या के माध्यम से चलाया जिसमें कुछ भी हटाया नहीं गया था। उन्होंने AI के 'अटेंशन' (ध्यान) को देखा और पूछा: "यदि हमें अभी कुछ सुराग फेंकने हों, तो किनसे अंतिम उत्तर देने में सबसे कम नुकसान होगा?"
उन्होंने "परफेक्ट" सुरागों के सेट को खोजने के लिए गोल्डन इवििक्शन (Golden Eviction) नामक विधि का उपयोग किया। फिर उन्होंने इस छोटे सहायक को इस "परफेक्ट" निर्णय लेने की प्रक्रिया की नकल करना सिखाया। यह एक छात्र को उत्तर कुंजी दिखाने जैसा है और कहने जैसा है, "सीखो कि सही उत्तर कैसे चुनते हैं।"

चरण 2: "रियल-वर्ल्ड सिमुलेशन" (रीइन्फोर्समेंट लर्निंग)

हालाँकि, जब AI वास्तव में कोई समस्या हल कर रहा होता है, तो "परफेक्ट" उत्तर कुंजी हमेशा सटीक नहीं होती, क्योंकि AI का दिमाग सोचने के साथ बदलता रहता है।
इसलिए, दूसरा चरण एक वीडियो गेम सिमुलेशन की तरह है। सहायक को निर्देश दिया जाता है: "जाओ, कुछ सुरागों को फेंक दो। यदि AI किसी विशिष्ट प्रकार के शब्द (जैसे कोई संख्या या प्रतीक जिसे गलत करना आसान है) पर गलती करता है, तो तुम्हें दंड (penalty) मिलेगा। यदि AI सही ढंग से हल करना जारी रखता है, तो तुम्हें इनाम (reward) मिलेगा।"
सहायक और भी स्मार्ट बनना सीख जाता है, यह समझते हुए कि कुछ "बोरिंग" शब्दों (लो-एंट्रॉपी टोकन) को रखना वास्तव में AI को बाद में संख्याओं के बारे में भ्रमित (hallucination) होने से रोकने के लिए महत्वपूर्ण है।

3. परिणाम: एक स्मार्ट, हल्का डेस्क

इस पेपर ने तीन अलग-अलग AI मॉडल्स पर कठिन गणितीय बेंचमार्क (AIME 2024 और 2025) का उपयोग करके इसका परीक्षण किया।

  • दावा: ForesightKV इन गणित की समस्याओं को पूर्ण, भारी नोटबुक की तरह ही अच्छी तरह से हल कर सकता है, लेकिन यह केवल आधे मेमोरी स्पेस का उपयोग करता है।
  • उपमा: यह एक ऐसे बैकपैक को ले जाने जैसा है जो 50% हल्का है, फिर भी आपको खेल जीतने के लिए आवश्यक हर एक सुराग याद रहता है।
  • गति: क्योंकि बैकपैक हल्का है, इसलिए AI तेजी से सोच सकता है और एक साथ अधिक लोगों को संभाल सकता है (उच्च थ्रूपुट)।

सारांश

ForesightKV AI की मेमोरी को प्रबंधित करने का एक नया तरीका है। पुराने नोट्स को अंधाधुंध फेंकने के बजाय, यह एक स्मार्ट, प्रशिक्षित सहायक का उपयोग करता है जो यह अनुमान लगाना सीखता है कि लंबे समय के समाधान के लिए कौन से नोट्स महत्वपूर्ण होंगे। एक "परफेक्ट उदाहरण" प्रशिक्षण चरण और एक "करके सीखने वाले" गेम चरण को जोड़कर, यह AI को जटिल तर्क पहेलियों को हल करने के लिए आवश्यक महत्वपूर्ण विवरणों को भूले बिना तेज़ और कुशल बनाए रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →