← नवीनतम पेपर
🤖 machine learning

QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

QEvict एक नवीन KV-कैश प्रबंधन योजना है जो अपरिवर्तनीय टोकन निष्कासन (eviction) को क्वांटाइजेशन का उपयोग करने वाले एक रिकवरेबल, तीन-स्तरीय दृष्टिकोण से बदल देती है ताकि उनके महत्व में वृद्धि होने पर पहले से हटाए गए टोकनों को गतिशील रूप से पुनर्स्थापित किया जा सके, जिससे लॉन्ग-कॉन्टेक्स्ट LLM डिकोडिंग में अटेंशन-ड्रिफ्ट रोबस्टनेस और प्रदर्शन को बढ़ाया जा सके।

मूल लेखक: Ayushman Garg, Akshita Gupta, Shaswata Bhattacharya, Abhishek Gupta, Sandeep Kumar, Manoj Kumar

प्रकाशित 2026-08-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ayushman Garg, Akshita Gupta, Shaswata Bhattacharya, Abhishek Gupta, Sandeep Kumar, Manoj Kumar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नया अध्याय लिखते समय 100 पन्नों की एक विशाल कहानी को याद रखने की कोशिश कर रहे हैं। हर बार जब आप एक वाक्य लिखते हैं, तो आपको पूरी कहानी को पीछे मुड़कर देखना पड़ता है ताकि यह सुनिश्चित हो सके कि आपके नए शब्द कथानक (plot) में फिट बैठते हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, ये "कहानियाँ" वे बातचीत या दस्तावेज़ हैं जिन्हें एक कंप्यूटर मॉडल पढ़ता है, और "पीछे मुड़कर देखना" KV कैश (Key-Value cache) नामक एक विशेष मेमोरी क्षेत्र में होता है। इस कैश को एक विशाल व्हाइटबोर्ड के रूप में समझें जहाँ AI कहानी के सबसे महत्वपूर्ण हिस्सों को लिख देता है ताकि उसे हर बार बोलने के लिए पूरी किताब दोबारा न पढ़नी पड़े।

समस्या यह है कि जैसे-जैसे कहानी लंबी होती जाती है, यह व्हाइटबोर्ड बहुत बड़ा होता जाता है। यह आपके कंप्यूटर की मेमोरी को AI के वास्तविक मस्तिष्क से भी तेज़ी से भर सकता है, जिससे कंप्यूटर लंबे कार्यों पर काम करने के दौरान धीमा हो जाता है या काम करना बंद कर देता है। इसे ठीक करने के लिए, वैज्ञानिकों ने दो मुख्य तरकीबें आज़माई हैं: इविकशन (Eviction) (कहानी के उन हिस्सों को फेंक देना जिन्हें वे उबाऊ समझते हैं) और क्वांटाइजेशन (Quantization) (स्थान बचाने के लिए कहानी को छोटी, लड़खड़ाती लिखावट में लिखना)। लेकिन इसमें एक पेंच है: यदि आप एक पन्ना फेंक देते हैं, तो आप उसे कभी वापस नहीं पा सकते। यदि आप इसे लड़खड़ाती लिखावट में लिखते हैं, तो बाद में इसे पढ़ना कठिन हो सकता है। बड़ा सवाल यह है: हम मेमोरी को छोटा कैसे रखें बिना अनजाने में उन सबसे महत्वपूर्ण मोड़ (plot twists) को हटाए जो कहानी के बिल्कुल अंत में सामने आ सकते हैं?

यहीं पर QEvict नामक एक नई विधि आती है, जो AI की मेमोरी के लिए एक स्मार्ट, तीन मंजिला लाइब्रेरी की तरह काम करती है। शोधकर्ताओं ने पाया कि चीज़ों को फेंक देने का पुराना तरीका बहुत कठोर था। उन्होंने खोजा कि कहानी का एक पन्ना अभी बेकार लग सकता है, लेकिन पाँच मिनट बाद वह सबसे महत्वपूर्ण सुराग बन सकता है। यदि AI उसे फेंक देता है, तो वह हमेशा के लिए चला जाता है। QEvict एक "रिकवरेबल" (पुनर्प्राप्त करने योग्य) मध्य मार्ग पेश करके इस समस्या को हल करता है। केवल "रखो" या "डिलीट करो" के बजाय, यह सिस्टम तीन स्तरों का उपयोग करता है:

  1. वीआईपी सेक्शन (फुल प्रिसिजन): कहानी के सबसे महत्वपूर्ण, उच्च-विश्वास वाले हिस्से हाई-डेफिनिशन, एकदम स्पष्ट मेमोरी में रहते हैं।
  2. आर्काइव (क्वांटाइज्ड टियर): वे हिस्से जो वर्तमान में उबाऊ हैं लेकिन बाद में महत्वपूर्ण हो सकते हैं, उन्हें एक "कंप्रेस्ड आर्काइव" में स्थानांतरित कर दिया जाता है। उन्हें कम गुणवत्ता वाले प्रारूप में लिखा जाता है (जैसे एक फोटो के बजाय एक स्केच), लेकिन उन्हें फेंका नहीं जाता। वे अभी भी वहीं हैं, इंतज़ार कर रहे हैं।
  3. कचरे का डिब्बा (इविक्टेड): केवल वे हिस्से जो वास्तव में, निश्चित रूप से बेकार हैं, उन्हें ही हटाया जाता है।

जादू तब होता है जब AI अपना नया अध्याय लिख रहा होता है। यदि उसे अचानक किसी ऐसे जानकारी की आवश्यकता होती है जो "आर्काइव" में रखी थी, तो सिस्टम तुरंत उस स्केच को एक हाई-डेफिनिशन फोटो में अपग्रेड कर देता है और उसे वीआईपी सेक्शन में ले आता है। यह एक ऐसे लाइब्रेरियन की तरह है जो धूल भरी, कंप्रेस्ड किताब को शेल्फ से निकाल सकता है, उसे फिर से उत्तम स्थिति में बहाल कर सकता है, और आपके पूछते ही उसे आपके हाथ में थमा सकता है।

यह पेपर दिखाता है कि QEvict का दृष्टिकोण पुराने "डिलीट या कीप" तरीकों की तुलना में बहुत अधिक स्मार्ट है। लंबी पठन समझ (reading comprehension), जटिल गणितीय समस्याओं और "नीडल-इन-अ-हेस्टैक" (एक विशाल टेक्स्ट में एक छोटा सा तथ्य ढूँढना) खोजों पर परीक्षण करके, QEvict ने लगातार बेहतर प्रदर्शन किया। इसने कम मेमोरी का उपयोग करते हुए भी कहानी को बेहतर ढंग से याद रखा। शोधकर्ताओं ने मापा कि इस विधि ने महत्वपूर्ण जानकारी को "मिस" करने की दर को अन्य तरीकों की तुलना में काफी कम कर दिया। उन्होंने यह भी पाया कि "आर्काइव" टियर इतना प्रभावी है कि जब AI को बहुत कम मेमोरी (पूर्ण आकार के केवल 5% तक) का उपयोग करने के लिए मजबूर किया जाता है, तब भी यह पहले की तुलना में कहानी को बहुत बेहतर तरीके से समझता है।

संक्षेप में, QEvict सुझाव देता है कि हमें मेमोरी को एक ऐसे एकतरफा रास्ते के रूप में नहीं देखना चाहिए जहाँ चीजें या तो पूर्ण होती हैं या हमेशा के लिए खत्म हो जाती हैं। एक मध्य चरण जोड़कर जहाँ जानकारी को सस्ते में संग्रहीत किया जा सकता है लेकिन ज़रूरत पड़ने पर पुनः प्राप्त किया जा सकता है, AI मॉडल लंबी और अधिक जटिल कार्यों को बिना स्पेस खत्म हुए संभाल सकते हैं। विभिन्न AI मॉडलों और बेंचमार्क पर मापे गए परिणाम संकेत देते हैं कि यह "रिकवरेबल इविकशन" लंबी-कंटेक्स्ट वाली AI को स्मार्ट और अधिक कुशल बनाने का एक व्यावहारिक और प्रभावी तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →