← नवीनतम पेपर
🤖 AI

SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation

SelKV एक प्रशिक्षण-मुक्त (training-free) फ्रेमवर्क है जो वैल्यू-वेक्टर समानता के आधार पर टोकन को चुनिंदा रूप से मर्ज या ड्रॉप करके और लॉजिट बायस (logit bias) के माध्यम से अटेंशन असंतुलन की भरपाई करके KV कैश को संकुचित करता है, जिससे मूल कैश का केवल 25% रखते हुए लगभग लॉसलेस जनरेशन गुणवत्ता और महत्वपूर्ण गति प्राप्त होती है।

मूल लेखक: Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur

प्रकाशित 2026-07-21
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नया अध्याय लिखते समय एक विशाल, 1,00,000 पन्नों की कहानी याद रखने की कोशिश कर रहे हैं। हर बार जब आप किसी कथानक (plot point) के बारे में सोचते हैं, तो आपको सही विवरण खोजने के लिए अपनी पूरी नोटबुक के पन्ने पलटने पड़ते हैं। जैसे-जैसे आप अधिक पन्ने लिखते जाते हैं, आपकी नोटबुक भारी होती जाती है, जब तक कि आपके हाथ उसे पकड़ने के लिए बहुत थक नहीं जाते। एक लार्ज लैंग्वेज मॉडल (LLM) के अंदर भी बिल्कुल ऐसा ही होता है जब वह लंबे टेक्स्ट को प्रोसेस करने की कोशिश करता है। ये मॉडल अविश्वसनीय रूप से स्मार्ट होते हैं, लेकिन उन्हें एक मेमोरी की समस्या होती है: जैसे-जैसे वे पढ़ते हैं, वे एक "की-वैल्यू कैश" (Key-Value cache)—जो उन्होंने अब तक देखा है उसका एक डिजिटल फाइलिंग सिस्टम है—स्टोर करते हैं ताकि वे समझ सकें कि आगे क्या होने वाला है। टेक्स्ट जितना लंबा होता है, यह फाइलिंग कैबिनेट उतना ही बड़ा होता जाता है, जिससे अंततः कंप्यूटर की सारी मेमोरी भर जाती है और सब कुछ धीमा हो जाता है।

इसे ठीक करने के लिए, वैज्ञानिकों ने दो मुख्य तरकीबें आजमाई हैं। पहली है "इविक्शन" (eviction), जो पुराने पन्नों को फेंक देने जैसा है जिन्हें आप महत्वहीन समझते हैं। दूसरी है "मर्जिंग" (merging), जो समान पन्नों को जगह बचाने के लिए आपस में चिपकाने जैसा है। लेकिन दोनों विधियों में एक खामी है। पन्ने फेंक देने से महत्वपूर्ण सुराग खो सकते हैं, और पन्नों को आपस में चिपकाने से अक्सर एक "धुंधला" (blurry) संस्करण बन जाता है जहाँ मॉडल यह भूल जाता है कि चिपके हुए समूह पर कितना ध्यान देना है। यह वैसा ही है जैसे यदि आपने बिल्ली की दस तस्वीरों को आपस में चिपका दिया हो; मॉडल अभी भी उस एक चिपके हुए ढेर को उतना ही ध्यान दे सकता है जितना कि वह एक फोटो को देता, भले ही अब वह दस फोटो का प्रतिनिधित्व करता हो। इससे मॉडल भ्रमित हो जाता है और गलतियाँ करने लगता है।

यहाँ आता है SelKV, एक नया, चतुर तरीका जो इन डिजिटल फाइलिंग कैबिनेट्स के लिए एक स्मार्ट लाइब्रेरियन की तरह काम करता है। पन्नों को अंधाधुंध चिपकाने या उन्हें कचरे में फेंकने के बजाय, SelKV एक "सॉफ्ट कोसाइन गेट" (soft cosine gate) का उपयोग करता है—इसे एक क्लब के बाउंसर की तरह समझें जो यह जांचता है कि दो पन्ने एक-दूसरे से कितने मिलते-जुलते हैं, इससे पहले कि वह तय करे कि क्या करना है। यदि दो पन्ने बहुत समान हैं, तो उन्हें मजबूती से आपस में चिपका दिया जाता है। यदि वे पूरी तरह से अलग हैं, तो बाउंसर मेमोरी को साफ रखने के लिए एक को बाहर भेज देता है। लेकिन असली जादू "अटेंशन कंपनसेशन" (attention compensation) है। चूंकि पन्नों को चिपकाने से आमतौर पर मॉडल उन्हें अनदेखा कर देता है, इसलिए SelKV चिपके हुए पन्नों में थोड़ा "वॉल्यूम बूस्ट" जोड़ देता है, यह सुनिश्चित करने के लिए कि मॉडल उन पर सही मात्रा में ध्यान दे।

शोधकर्ताओं ने तीन अलग-अलग AI मॉडलों पर 16 विभिन्न कार्यों के माध्यम से इस प्रणाली का परीक्षण किया, जिसमें कई दस्तावेजों के बारे में प्रश्नों के उत्तर देने से लेकर कोड लिखना शामिल है। उन्होंने पाया कि केवल 25% मूल मेमोरी स्पेस को बनाए रखकर, SelKV का प्रदर्शन लगभग उतना ही अच्छा रहा जितना कि पूर्ण मेमोरी के साथ होता है, और कुछ कठिन मल्टी-डॉक्यूमेंट क्विज़ में, इसने पूर्ण संस्करण से भी बेहतर प्रदर्शन किया। ऐसा लगता है कि चयनात्मक होकर, AI वास्तव में कहानी के सबसे महत्वपूर्ण हिस्सों पर ध्यान केंद्रित कर रहा था। इसके अलावा, जब टेक्स्ट बहुत बड़ा (1,00,000 टोकन) हो गया, तो इस पद्धति ने AI को टेक्स्ट को 3.3 गुना तेज़ी से डिकोड करने में सक्षम बनाया। पेपर सुझाव देता है कि यह दृष्टिकोण विशेष रूप से आधुनिक AI मॉडलों के लिए अच्छा है जो एक विशिष्ट प्रकार के अटेंशन (जिसे GQA कहा जाता है) का उपयोग करते हैं, जो उनकी याददाश्त खोए बिना इन शक्तिशाली दिमागों को तेज़ी से चलाने का एक तरीका प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →