← नवीनतम पेपर
🤖 machine learning

Epiphany-Aware KV Cache Eviction Without the Attention Matrix

यह शोध पत्र EpiKV प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) KV कैश इविक्शन विधि है जो शोर वाले अटेंशन-आधारित स्कोरिंग को आंतरिक प्रतिनिधित्व परिवर्तनों से प्राप्त एक "एपिफनी स्कोर" (epiphany score) से बदल देता है, जिससे अटेंशन मैट्रिक्स भौतिकीकरण (materialization) या कस्टम कर्नेल की आवश्यकता के बिना काफी लंबे कॉन्टेक्स्ट विंडो और तेज़ इन्फरेंस गति सक्षम होती है।

मूल लेखक: Steven Kolawole, Virginia Smith

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Steven Kolawole, Virginia Smith

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत कठिन गणित की समस्या को हल करने की कोशिश कर रहे हैं। उत्तर पाने के लिए, आपके मस्तिष्क (या इस मामले में, एक AI) को हजारों चरणों के माध्यम से सोचना होगा, और एक लंबी "सोच की श्रृंखला" (chain of thought) लिखनी होगी।

समस्या यह है कि AI की अल्पकालिक स्मृति (जिसे KV कैश कहा जाता है) एक छोटे व्हाइटबोर्ड की तरह है। जैसे-जैसे सोचने की प्रक्रिया लंबी होती जाती है, व्हाइटबोर्ड भरता जाता है। यदि आप पुराने विचारों को मिटाए बिना नए विचार लिखते रहते हैं, तो व्हाइटबोर्ड की जगह खत्म हो जाएगी, और AI क्रैश हो जाएगा या काम करना बंद कर देगा।

इसे ठीक करने के लिए, हमें यह तय करने का एक स्मार्ट तरीका चाहिए कि क्या रखना है और किसे फेंक देना है। यह शोध पत्र यह तय करने का एक नया, अधिक समझदार तरीका पेश करता है कि क्या रखना है और किसे हटाना है।

पुराना तरीका: "ऊँची आवाज़" की समस्या

पहले, AI सिस्टम यह तय करने के लिए कि क्या रखना है, अटेंशन मैट्रिक्स (Attention Matrix) को देखता था। इसे एक वॉल्यूम मीटर की तरह समझें। सिस्टम पूछता था: "AI ने किन शब्दों पर सबसे अधिक ध्यान दिया?"

लेखकों का तर्क है कि यह एक बुरा विचार है, जिसके दो कारण हैं:

  1. यह शोर भरा है: कभी-कभी AI शब्दों पर इसलिए ध्यान देता है क्योंकि वे सामान्य या दोहराव वाले होते (जैसे "the" या "and"), न कि इसलिए कि वे महत्वपूर्ण हैं। यह एक शोर भरी पार्टी की तरह है जहाँ सबसे तेज़ बोलने वाला व्यक्ति ज़रूरी तौर पर सबसे महत्वपूर्ण बात नहीं कह रहा होता।
  2. यह भारी है: वॉल्यूम मीटर की जाँच करने के लिए, सिस्टम को हर शब्द के दूसरे शब्द के साथ संबंध का एक विशाल, जटिल मानचित्र बनाना पड़ता है। यह मानचित्र इतना बड़ा होता है कि AI के लंबे गणित की समस्या पूरी करने से पहले ही कंप्यूटर की मेमोरी भर जाती है। यह एक किताब पढ़ने के लिए अपने बैकपैक में पूरी लाइब्रेरी ले जाने की कोशिश करने जैसा है।

नया तरीका: "आहा!" वाला क्षण (EPIKV)

लेखक EPIKV नामक एक नई विधि प्रस्तावित करते हैं। "वॉल्यूम" (अटेंशन) सुनने के बजाय, वे AI की आंतरिक स्थिति में परिवर्तन देखते हैं।

AI के मस्तिष्क की कल्पना एक नदी के रूप में करें।

  • उबाऊ भाग: जब AI केवल फिलर शब्द लिख रहा होता है या खुद को दोहरा रहा होता है, तो नदी सुचारू रूप से और शांति से बहती है। कुछ भी खास नहीं बदलता।
  • "एपिफनी" (ज्ञानोदय) वाले भाग: जब AI को कोई बड़ी सफलता मिलती है, कोई चरण हल होता है, या किसी नए रास्ते का एहसास होता है, तो नदी अचानक उफान पर आ जाती है। पानी का स्तर बढ़ जाता है, धारा बदल जाती है, और परिदृश्य बदल जाता है।

नई विधि टोकन को इन उछालों (surges) के आधार पर स्कोर करती है। यदि कोई टोकन AI की आंतरिक "नदी" में बड़ा बदलाव लाता है, तो वह एक "एपिफनी टोकन" है और उसे रखना सार्थक है। यदि नदी शांत रहती है, तो टोकन संभवतः केवल फिलर है और उसे हटाया जा सकता है।

उन्होंने इसे कैसे किया (दो-परत वाली ट्रिक)

शोधकर्ताओं ने पाया कि AI का मस्तिष्क एक समान नहीं है; इसके अलग-अलग "फ्लोर" (परतें) हैं जो अलग-अलग काम करते हैं।

  • मध्यम फ्लोर (परतें 7-13): जब यहाँ नदी उफान पर आती है, तो इसका मतलब आमतौर पर यह होता है कि कुछ महत्वपूर्ण हो रहा है (जैसे कोई प्रमुख तथ्य खोजना)। यह एक अच्छा संकेत है।
  • ऊपरी-मध्यम फ्लोर (परतें 18-25): आश्चर्यजनक रूप से, जब यहाँ नदी उफान पर आती है, तो इसका मतलब अक्सर यह होता है कि AI केवल एक पैटर्न को सुचारू रूप से जारी रख रहा है (अगले शब्द की भविष्यवाणी कर रहा है)। यह महत्व के लिए वास्तव में एक बुरा संकेत है।

इसलिए, उनका फॉर्मूला सरल है: मध्यम फ्लोर्स से "अच्छे उछालों" को लें और ऊपरी फ्लोर्स के "बुरे उछालों" को घटा दें। इससे उन्हें वास्तव में क्या मायने रखता है, इसका एक साफ स्कोर मिलता है।

परिणाम: तेज़ और स्मार्ट

क्योंकि इस नई विधि को उस विशाल, मेमोरी-हंगरी "वॉल्यूम मैप" (अटेंशन मैट्रिक्स) को बनाने की आवश्यकता नहीं है, इसलिए इसके दो बड़े लाभ हैं:

  1. यह अधिक समा सकता है: AI बिना मेमोरी खत्म हुए 16 गुना लंबी सोचने की श्रृंखला को संभाल सकता है।
  2. यह तेज़ है: यह पुराने तरीकों की तुलना में 2.8 गुना तेज़ चलता है क्योंकि यह भारी काम को छोड़ देता है।

कठिन गणित प्रतियोगिताओं (MATH-500 और AIME-2024) पर परीक्षणों में, इस नई विधि ने पुराने तरीकों के समान या उनसे बेहतर प्रदर्शन किया, लेकिन बिना मेमोरी क्रैश के।

सारांश

यह शोध पत्र "लाउड" क्षणों (अटेंशन वेट्स) को सुनने के बजाय "आहा!" क्षणों (विचारों में अचानक परिवर्तन) को देखकर AI की मेमोरी को प्रबंधित करने का एक तरीका पेश करता है। यह एक विशाल मेमोरी बाधा (bottleneck) से बचाता है, जिससे AI बिना अटके बहुत लंबी और जटिल समस्याओं के माध्यम से सोच सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →