← नवीनतम पेपर
🤖 machine learning

Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction

यह शोधपत्र एक वैश्विक रिटेंशन-आधारित (retention-based) KV कैश इविक्शन विधि प्रस्तुत करता है जो मेमोरी उपयोग को कम करने के लिए अप्रासंगिक टोकन को चुनिंदा रूप से हटाने के लिए सीखता है और अटेंशन डाइल्यूशन (attention dilution) को कम करके लॉन्ग-कॉन्टेक्स्ट रीजनिंग प्रदर्शन में सुधार करता है, जिससे यह विविध बेंचमार्क पर फुल-कैश इन्फरेंस से भी बेहतर प्रदर्शन करता है।

मूल लेखक: Ngoc Bui, Hieu Trung Nguyen, Arman Cohan, Rex Ying

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ngoc Bui, Hieu Trung Nguyen, Arman Cohan, Rex Ying

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Make Each Token Count" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

बड़ी समस्या: "बहुत अधिक जानकारी" की बाधा (The "Too-Much-Information" Bottleneck)

कल्पना कीजिए कि आप एक जटिल रहस्य को सुलझाने की कोशिश कर रहे एक शानदार जासूस हैं। अपना काम करने के लिए, आपके पास एक विशाल व्हाइटबोर्ड है जहाँ आप मिलने वाले हर एक सुराग, गवाह के बयान और सबूत को लिखते हैं।

AI की दुनिया में (विशेष रूप से लार्ज लैंग्वेज मॉडल्स में), इस व्हाइटबोर्ड को KV Cache कहा जाता है। जैसे-जैसे AI एक लंबी कहानी पढ़ता है या एक लंबा वीडियो देखता है, वह कहानी के अंत को लिखते समय शुरुआत को न भूल जाए, इसके लिए वह हर शब्द और इमेज पिक्सेल को इस बोर्ड पर लिख देता है।

चुनौती: यह व्हाइटबोर्ड बहुत बड़ा हो जाता है। यदि कहानी 1,00,000 शब्दों की है, तो बोर्ड विशाल होगा।

  1. यह जगह भर देता है: अंततः, बोर्ड इतना भर जाता है कि AI उस पर नए सुराग नहीं लिख पाता।
  2. यह बहुत धीमा हो जाता है: उस एक महत्वपूर्ण सुराग (जैसे "बटलर ने ही किया") को खोजने के लिए, जासूस को हजारों अप्रासंगिक नोट्स (जैसे "बटलर ने लाल टाई पहनी थी" या "बारिश हो रही थी") को स्कैन करना पड़ता है। इससे सब कुछ धीमा हो जाता है।

पुराना समाधान: "फर्स्ट-इन, फर्स्ट-आउट" कचरा पात्र (The "First-In, First-Out" Trash Can)

स्पेस की समस्या को ठीक करने के लिए, पिछले तरीकों ने एक सख्त सफाईकर्मी की तरह काम किया। वे कहते थे, "हम भर गए हैं! नए के लिए जगह बनाने के लिए पुराने नोट्स फेंक दो।"

खामी: यह खतरनाक है। कभी-कभी सबसे पुराना नोट ही सबसे महत्वपूर्ण होता है (जैसे "बटलर के पास बंदूक है")। उसे सिर्फ इसलिए फेंक देना क्योंकि वह पुराना है, AI को मूर्ख बना देता है। अन्य तरीकों ने यह देखने की कोशिश की कि AI वर्तमान में किन शब्दों को देख रहा है, लेकिन वे अक्सर अल्पदर्शी (short-sighted) थे, ऐसी चीजें फेंक देते थे जो पाँच मिनट बाद उपयोगी होने वाली थीं।

नया समाधान: "स्मार्ट रिटेंशन" सिस्टम (TrimKV)

यह पेपर एक नया तरीका पेश करता है जिसे TrimKV (या DBTrimKV) कहा जाता है। चीजों को बस फेंकने के बजाय, यह एक बेहतर सवाल पूछता है: "कौन से सुराग वास्तव में भविष्य में रहस्य सुलझाने में मेरी मदद करेंगे?"

यह कैसे काम करता है, इसे तीन सरल अवधारणाओं का उपयोग करके समझा जा सकता है:

1. "फ्यूचर यूटिलिटी" स्कोर (The "Future Utility" Score)

कल्पना कीजिए कि आपके व्हाइटबोर्ड पर मौजूद हर सबूत के साथ एक छोटा सा स्टिकी नोट लगा है। यह स्टिकी नोट भविष्यवाणी करता है कि जांच में आगे चलकर वह सुराग कितना उपयोगी होगा।

  • उच्च स्कोर: "यह बंदूक बहुत महत्वपूर्ण है। इसे हमेशा के लिए रखें।"
  • कम स्कोर: "यह लाल टाई अप्रासंगिक है। इसे फेंक दें।"

AI इन स्कोर को स्वचालित रूप से लिखना सीख जाता है। यह केवल यह नहीं देखता कि अभी क्या हो रहा है; यह देखता है कि कल किसकी आवश्यकता होगी।

2. "ग्लोबल कॉम्पिटिशन" (The "Global Competition" - द ग्रेट फ़िल्टर)

अतीत में, AI के विभिन्न हिस्से (विभिन्न "लेयर्स" और "हेड्स") के अपने अलग-अलग छोटे व्हाइटबोर्ड होते थे जिनकी अपनी सीमाएं होती थीं। यदि एक बोर्ड भर जाता था, तो वह चीजों को फेंक देता था भले ही दूसरे बोर्ड में जगह खाली हो।

यह नया तरीका पूरे AI के लिए एक विशाल, साझा व्हाइटबोर्ड बनाता है।

  • उपमा: कल्पना कीजिए कि एक VIP पार्टी चल रही है। पुराने तरीके में, हर कमरे में एक बाउंसर था जो 10 लोगों को अंदर आने देता था। यदि कोई VIP गलियारे में होता, तो वह अंदर नहीं आ पाता क्योंकि कमरा भरा हुआ था।
  • नया तरीका: पूरे क्लब के लिए एक ही बाउंसर है। VIP (सबसे उपयोगी सुराग) अंदर आ सकते हैं, चाहे वे किसी भी कमरे से आए हों। "डिस्ट्रैक्टर्स" (अप्रासंगिक शोर) को बाहर निकाल दिया जाता है, भले ही वे एक "VIP" कमरे में क्यों न हों।

3. "अटेंशन डाइल्यूशन" से लड़ना (Fighting "Attention Dilution")

यह पेपर तर्क देता है कि बहुत अधिक जानकारी होना वास्तव में AI को नुकसान पहुँचाता है।

  • उपमा: कल्पना कीजिए कि आप एक शांत कमरे में अपने दोस्त की फुसफुसाहट सुनने की कोशिश कर रहे हैं। आप उन्हें स्पष्ट रूप से सुन सकते हैं। अब, कल्पना कीजिए कि वही दोस्त 10,000 लोगों की चिल्लाती हुई भीड़ के बीच फुसफुसा रहा है। आप उन्हें अब नहीं सुन सकते, भले ही वे अभी भी फुसफुसा रहे हों।
  • परिणाम: "चिल्लाती हुई भीड़" (अप्रासंगिक टोकन) को आक्रामक रूप से हटाकर, AI "फुसफुसाहट" (महत्वपूर्ण सबूत) को बहुत बेहतर तरीके से सुन सकता है। कभी-कभी, जानकारी को हटाना वास्तव में AI को अधिक स्मार्ट बनाता है क्योंकि यह उसे विचलित होने से रोकता है।

उन्होंने क्या पाया?

शोधकर्ताओं ने कठिन कार्यों पर इसका परीक्षण किया, जैसे गणित की समस्याओं को हल करना, लंबे वीडियो का विश्लेषण करना और लंबी बातचीत करना।

  • यह स्पेस बचाता है: वे मेमोरी के उपयोग को बहुत बड़ी मात्रा में कम कर सके (कभी-कभी मूल डेटा का केवल 10-20% रखकर) बिना AI के भ्रमित हुए।
  • यह प्रदर्शन में सुधार करता है: कई मामलों में, AI ने पूर्ण मेमोरी की तुलना में कम मेमोरी के साथ बेहतर प्रदर्शन किया। यह साबित करता है कि जब ध्यान भटकाने वाली चीजों को हटाने की बात आती है, तो "कम ही अधिक है" (less is more)।
  • यह छवियों और टेक्स्ट दोनों के लिए काम करता है: इसने टेक्स्ट और विजुअल डेटा (जैसे वीडियो में इमेज) दोनों को एक साथ सफलतापूर्वक प्रबंधित किया, यह तय करते हुए कि किन पिक्सेल और शब्दों को रखना है।

सारांश

यह पेपर AI को एक बेहतर जासूस बनना सिखाता है। हर एक कागज के टुकड़े को इकट्ठा करने के बजाय, यह पहचानना सीखता है कि कौन से "स्वर्ण कण" (Golden Nuggets) हैं और कौन सी "मिट्टी और पत्थर" (Rock and Dirt) है। ऐसा करके, यह तेज़ चलता है, कम मेमोरी का उपयोग करता है, और वास्तव में समस्याओं को अधिक सटीकता से हल करता है क्योंकि यह शोर से विचलित नहीं होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →