← नवीनतम पेपर
💻 computer science

DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference

DepthKV एक नवीन लेयर-डिपेंडेंट KV कैश प्रूनिंग फ्रेमवर्क है जो परतों की व्यक्तिगत प्रूनिंग संवेदनशीलता के आधार पर एक निश्चित वैश्विक मेमोरी बजट को गतिशील रूप से आवंटित करके लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस को अनुकूलित करता है, जिससे यह पारंपरिक यूनिफॉर्म प्रूनिंग विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Zahra Dehghanighobadi, Asja Fischer

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zahra Dehghanighobadi, Asja Fischer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "ज़रूरत से ज़्यादा भरा हुआ बैकपैक"

कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (LLM) एक बुद्धिमान छात्र है जो एक लंबी कहानी लिखने या एक विशाल किताब का सारांश लिखने की कोशिश कर रहा है। ऐसा करने के लिए, छात्र को यह याद रखने की ज़रूरत है कि उसने अब तक क्या पढ़ा है।

कंप्यूटर की दुनिया में, इस मेमोरी को KV कैश (KV Cache) कहा जाता है। KV कैश को एक बैकपैक की तरह समझें जिसे छात्र अपने साथ लेकर चलता है। हर बार जब छात्र एक नया शब्द पढ़ता है, तो वह उस शब्द के बारे में एक नोट अपने बैकपैक में डाल देता है।

  • समस्या: यदि छात्र 100 पन्नों की किताब पढ़ता है, तो बैकपैक बहुत बड़ा हो जाता है। यदि वे 1,000 पन्नों की किताब पढ़ते हैं, तो बैकपैक इतना भारी और बोझिल हो जाता है कि छात्र की पीठ टूट जाती है (कंप्यूटर मेमोरी खत्म हो जाती है)।
  • वर्तमान समाधान: बैकपैक को बहुत भारी होने से बचाने के लिए, छात्र कुछ नोट्स फेंक देता है। वर्तमान विधि एक समान नियम (uniform rule) की तरह है: "चाहे किताब का कोई भी पन्ना हो, उसके 60% नोट्स फेंक दो, चाहे कुछ भी हो।"

खोज: सभी पन्ने समान नहीं होते

इस पेपर के लेखकों ने महसूस किया कि "समान नियम" एक गलती है। उन्होंने पाया कि मस्तिष्क के सभी हिस्से (या कंप्यूटर के लेयर्स) समान रूप से महत्वपूर्ण नहीं हैं।

कल्पना कीजिए कि छात्र का मस्तिष्क कई मंजिलों (लेयर्स) वाली एक बहुमंजिला इमारत है:

  • पहली मंजिल (शुरुआती लेयर्स): ये शब्दों और व्याकरण को पहचानने जैसी बुनियादी चीज़ों को संभालती हैं।
  • दसवीं मंजिल (बीच की लेयर्स): ये गहरे अर्थ, कथानक (plot) और तर्क को संभालती हैं।
  • बीसवीं मंजिल (अंतिम लेयर्स): ये अंतिम पॉलिश और वाक्य संरचना को संभालती हैं।

शोधकर्ताओं ने परीक्षण किया कि क्या होता है यदि वे केवल विशिष्ट मंजिलों से नोट्स हटा देते हैं। उन्होंने पाया कि:

  1. यदि आप बीच की मंजिलों से नोट्स हटा देते हैं, तो छात्र कहानी पूरी तरह भूल जाता है और बकवास लिखने लगता है।
  2. यदि आप ऊपरी या निचली मंजिलों से नोट्स हटा देते हैं, तो छात्र अभी भी कहानी सुना सकता है, शायद थोड़े अलग लहजे या शैली के साथ, लेकिन मूल अर्थ बना रहता है।

उपमा (Analogy): यह एक मूविंग ट्रक में सामान पैक करने जैसा है। वर्तमान विधि लिविंग रूम, किचन और बेडरूम से समान रूप से 60% फर्नीचर फेंक देने के समान है। नई खोज यह है कि किचन (बीच की लेयर्स) में सबसे महत्वपूर्ण चीजें (रेसिपी की किताबें और चूल्हा) होती हैं। यदि आप किचन से 60% सामान फेंक देते हैं, तो आप खाना नहीं बना सकते। लेकिन यदि आप बेडरूम (कम महत्वपूर्ण लेयर्स) से 60% सामान फेंक देते हैं, तो भी आप सो सकते हैं।

समाधान: DepthKV (एक स्मार्ट पैकिंग लिस्ट)

यह पेपर DepthKV नामक एक नई प्रणाली प्रस्तावित करता है। हर मंजिल के साथ एक जैसा व्यवहार करने के बजाय, DepthKV एक स्मार्ट पैकिंग मैनेजर की तरह काम करता है।

  1. यह महत्व को मापता है: यह जांचता है कि कौन सी मंजिलें "संवेदनशील" (कहानी के लिए महत्वपूर्ण) हैं और कौन सी "मजबूत" (नोट्स खोने के बाद भी टिक सकती हैं) हैं।
  2. यह बजट का पुनर्वितरण करता है: यह बैकपैक का कुल आकार निश्चित रखता है, लेकिन स्थान को अलग-अलग तरीके से वितरित करता है:
    • महत्वपूर्ण मंजिलें (किचन): लगभग सभी नोट्स रखें। यहाँ कुछ भी न फेंकें।
    • कम महत्वपूर्ण मंजिलें (बेडरूम): जगह बचाने के लिए यहाँ नोट्स को आक्रामक रूप से हटा दें।

यह "महत्व" को कैसे मापता है?

कंप्यूटर को कैसे पता चलता है कि कौन सी मंजिल "किचन" है? शोधकर्ताओं ने InfoNCE नामक एक गणितीय परीक्षण का उपयोग किया।

  • उपमा: कल्पना कीजिए कि आप बैकपैक को हिलाते हैं।
    • यदि किसी विशिष्ट मंजिल के नोट्स बाहर गिर जाते हैं और छात्र तुरंत कहानी भूल जाता है, तो वह मंजिल नाजुक (fragile) है (उच्च महत्व)।
    • यदि किसी दूसरी मंजिल के नोट्स बाहर गिर जाते हैं और छात्र को ध्यान भी नहीं लगता, तो वह मंजिल मजबूत (robust) है (कम महत्व)।
    • DepthKV यह तय करने के लिए कि नोट्स कहाँ सुरक्षित रखने हैं, इसी "झटका टेस्ट" (shake test) का उपयोग करता है।

परिणाम: स्मार्ट पैकिंग

शोधकर्ताओं ने तीन अलग-अलग प्रकार के छात्रों (AI मॉडल: Gemma, LLaMA, और Qwen) और विभिन्न कार्यों (समाचार का सारांश देना, प्रश्नों के उत्तर देना, गणित हल करना) पर इसका परीक्षण किया।

  • पुराना तरीका (Uniform Pruning): नोट्स को समान रूप से हटाया गया। छात्र अक्सर भ्रमित हो जाता था या छोटे, अधूरे उत्तर देता था।
  • नया तरीका (DepthKV): नोट्स को रणनीतिक रूप से हटाया गया।
    • परिणाम: छात्र ने बेहतर सारांश लिखे, प्रश्नों के अधिक सटीक उत्तर दिए, और गणित के सवालों को सही ढंग से हल किया, और यह सब ठीक उसी आकार का बैकपैक लेकर किया।

सारांश

यह पेपर तर्क देता है कि "एक ही नियम सबके लिए लागू नहीं होता"। यह महसूस करके कि एक AI मॉडल के विभिन्न हिस्से अलग-अलग भूमिकाएँ निभाते हैं, हम उसकी मेमोरी से क्या हटाना है, इसके बारे में बहुत अधिक स्मार्ट हो सकते हैं। DepthKV वह विधि है जो सबसे महत्वपूर्ण यादों को सुरक्षित रखती है और अनावश्यक चीज़ों को बेरहमी से काट देती है, जिससे AI को मेमोरी खत्म हुए बिना लंबी कहानियों को संभालने की अनुमति मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →