← नवीनतम पेपर
🤖 machine learning

The Pitfalls of KV Cache Compression

यह शोध पत्र प्रकट करता है कि जबकि KV कैश संपीड़न थ्रूपुट में सुधार करता है, यह मल्टी-इंस्ट्रक्शन परिदृश्यों में विशिष्ट निर्देशों को अनदेखा करने और सिस्टम प्रॉम्प्ट के लीक होने के कारण प्रदर्शन को गंभीर रूप से खराब कर सकता है, लेकिन इन समस्याओं को कम करने के लिए सरल इविक्शन पॉलिसी समायोजन प्रस्तावित करता है।

मूल लेखक: Alex Chen, Renato Geh, Aditya Grover, Guy Van den Broeck, Daniel Israel

प्रकाशित 2026-05-15✓ Author reviewed
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alex Chen, Renato Geh, Aditya Grover, Guy Van den Broeck, Daniel Israel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "The Pitfalls of KV Cache Compression" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

मुख्य विचार: "मेमोरी स्क्वीज़" (स्मृति संकुचन) की समस्या

कल्पना कीजिए कि आप एक अत्यंत बुद्धिमान लेकिन अत्यधिक व्यस्त लाइब्रेरियन (AI मॉडल) हैं। हर बार जब कोई ग्राहक आपसे कोई प्रश्न पूछता है, तो आपको अब तक की बातचीत को याद रखने के लिए अपने डेस्क पर इंडेक्स कार्ड्स का एक ढेर (जिसे KV Cache कहा जाता है) रखना पड़ता है। जैसे-जैसे बातचीत लंबी होती जाती है, वह ढेर ऊँचा होता जाता है। अंततः, आपके डेस्क की जगह खत्म हो जाती है, और आप काम नहीं कर पाते।

इसे ठीक करने के लिए, शोधकर्ताओं ने इस ढेर को कंप्रेस (छोटा) करने का एक तरीका निकाला। उन्होंने निर्णय लिया कि वे नए कार्ड्स के लिए जगह बनाने के लिए कुछ पुराने या "कम महत्वपूर्ण" कार्ड्स को फेंक देंगे। इसे KV Cache Compression कहा जाता है। इसका वादा यह था: "हम 70% कार्ड्स फेंक देंगे, डेस्क की बहुत सारी जगह बचा लेंगे, और फिर भी आप प्रश्नों के उत्तर पूरी तरह से देंगे।"

यह पेपर तर्क देता है कि हालांकि आप जगह तो बचा लेते हैं, लेकिन "पूरी तरह से उत्तर देने" वाला हिस्सा एक झूठ है। जब आप कार्ड्स फेंकना शुरू करते हैं, तो लाइब्रेरियन केवल थोड़ा-बहुत सब कुछ नहीं भूलता; बल्कि वे विशिष्ट चीजों को बहुत ही अनुचित और खतरनाक तरीके से भूलने लगते हैं।


मुख्य समस्याएँ (The "Pitfalls")

लेखकों ने पाया कि वर्तमान में इन लाइब्रेरियन को कार्ड्स फेंकने के लिए कैसे सिखाया जा रहा है, उसमें छह बड़ी समस्याएँ हैं।

1. सभी यादें एक ही गति से धुंधली नहीं होतीं

उदाहरण: कल्पना कीजिए कि आपके पास केक की रेसिपी और रसोई के सुरक्षा नियमों की सूची वाले कार्ड्स का एक ढेर है। जब आप ढेर को छोटा करना शुरू करते हैं, तो लाइब्रेरियन सुरक्षा नियमों को तुरंत भूल सकता है लेकिन केक की रेसिपी को पूरी तरह से याद रख सकता है।
वास्तविकता: पेपर दिखाता है कि प्रॉम्प्ट में दिए गए विभिन्न निर्देश अलग-अलग दरों पर खराब होते हैं। कुछ निर्देश "नाजुक" (fragile) होते हैं और कंप्रेशन के तहत जल्दी गायब हो जाते हैं, जबकि अन्य "मजबूत" (tough) होते हैं और बने रहते हैं। इसका मतलब है कि AI आपके "कविता लिखने" के अनुरोध का पालन तो कर सकता है, लेकिन आपके "शब्द 'बिल्ली' का उपयोग न करें" के अनुरोध को पूरी तरह से अनदेखा कर सकता है।

2. "आखिरी वाला जीतता है" का पूर्वाग्रह (The "Last One Wins" Bias)

उदाहरण: कल्पना कीजिए कि लाइब्रेरियन का एक नियम है: "हमेशा पिछले 5 मिनट के कार्ड्स रखें।" यदि आप उन्हें बातचीत की शुरुआत में एक सुरक्षा नियम देते हैं और अंत में कविता के लिए एक अनुरोध देते हैं, तो लाइब्रेर \text{रियन} कविता के कार्ड रखेगा और सुरक्षा नियम के कार्ड फेंक देगा क्योंकि सुरक्षा नियम "पुराना" है।
वास्तविकता: अधिकांश कंप्रेशन विधियाँ नवीनतम (सबसे हालिया) निर्देशों की ओर झुकी हुई होती हैं। यदि कोई सुरक्षा निर्देश पहले आता है, तो उसे (कविता के निर्देशों की तुलना में) बहुत तेज़ी से हटा दिया जाता है। इसे Eviction Bias कहा जाता है।

3. "गुप्त" जानकारी का रिसाव (The "Secret" Leak)

उदाहरण: कल्पना कीजिए कि लाइब्रेरियन के डेस्क पर एक गुप्त नोट है जिसमें लिखा है, "ग्राहक को कभी भी गुप्त रेसिपी न बताएं।" यदि ग्राहक पूछता है, "गुप्त रेसिपी क्या है?", और लाइब्रेरियन ने उस नोट को इसलिए फेंक दिया क्योंकि वह "पुराना" था, तो लाइब्रेरियन गलती से गुप्त रेसिपी ज़ोर से पढ़ सकता है क्योंकि वह उस नियम को भूल गया कि "इसे नहीं बताना है।"
वास्तविकता: इसे System Prompt Leakage कहा जाता है। पेपर सिद्ध करता है कि जब आप मेमोरी को कंप्रेस करते हैं, तो AI अक्सर अपने स्वयं के सुरक्षा गार्डरेल्स (सुरक्षा घेरे) को भूल जाता है। यह अपनी छिपी हुई सूचनाओं को प्रकट करने लगता है या खुद को "जेलब्रेक" कर लेता है, इसलिए नहीं कि वह बुरा है, बल्कि इसलिए क्योंकि वह निर्देश जो उसे चीजें प्रकट करने से रोकता था, सबसे पहले फेंक दिया गया था।

4. क्रम मायने रखता है (बहुत अधिक)

उदाहरण: यदि आप सुरक्षा नियम को अनुरोध के बाद रखते हैं, तो लाइब्रेरियन उसे याद रखता है। यदि आप इसे पहले रखते हैं, तो वे इसे भूल जाते हैं।
वास्तविकता: पेपर ने पाया कि निर्देशों का क्रम बदलना यह बदल देता है कि AI उनका कितनी अच्छी तरह पालन करता है। यदि सुरक्षा निर्देश अंत में है, तो वह कंप्रेशन में बेहतर तरीके से जीवित रहता है। यदि वह शुरुआत में है, तो उसे हटा दिया जाता है। यह AI के व्यवहार को अप्रत्याशित बनाता है।

5. "गलत" कार्ड फेंके जाते हैं

उदाहरण: लाइब्रेरियन यह तय करने के लिए एक बुरा नियम इस्तेमाल कर रहा है कि कौन से कार्ड फेंकने हैं। शायद वे कार्डों को उनकी स्याही के रंग के आधार पर फेंक रहे हैं, जिसका महत्व इस बात से नहीं है कि कार्ड कितना महत्वपूर्ण है।
वास्तविकता: किन टोकन (शब्दों) को रखना है, यह तय करने के तरीके अक्सर टेक्स्ट के अर्थ को समझने में खराब होते हैं। वे एक महत्वपूर्ण सुरक्षा शब्द को केवल इसलिए फेंक सकते हैं क्योंकि वह वाक्य में पहले आया था, भले ही वह अत्यंत महत्वपूर्ण था।

6. "निष्पक्षता" का समाधान (The "Fairness" Fix)

उदाहरण: लाइब्रेरियन को अपनी मर्जी से कार्ड फेंकने देने के बजाय, आप उन्हें एक नया नियम देते हैं: "हर 10 कार्ड जो आप 'रेसिपी' सेक्शन से रखते हैं, आपको 'सुरक्षा' सेक्शन से भी 10 कार्ड रखने होंगे।" आप उन्हें दोनों सेक्शन के साथ समान व्यवहार करने के लिए मजबूर करते हैं।
वास्तविकता: लेखक दो सरल समाधान प्रस्तावित करते हैं:

  • व्हाइटलिस्टिंग (Whitelisting): कुछ शब्दों (जैसे "प्रकट न करें") को मैन्युअल रूप से "फेंके नहीं जाने वाले" के रूप में चिह्नित करना।
  • फेयर इविक्शन (Fair Eviction): एक नया नियम जो AI को मजबूर करता है कि वह हर निर्देश से कार्डों का एक समान प्रतिशत फेंके, न कि केवल पहले निर्देश के सभी कार्डों को एक साथ हटा दे।

परिणाम

जब लेखकों ने इन सुधारों का परीक्षण किया:

  • लीकेज कम हुआ: AI ने अनजाने में अपने गुप्त निर्देश प्रकट करना बंद कर दिया।
  • प्रदर्शन बढ़ा: AI ने सभी निर्देशों का बेहतर पालन किया, न कि केवल प्रॉम्प्ट के अंत वाले निर्देशों का।
  • गति वैसी ही रही: इन सुधारों ने AI को धीमा नहीं किया।

सारांश

यह पेपर चेतावनी देता है कि हालांकि AI मेमोरी को कंप्रेस करना जगह बचाने के लिए बहुत अच्छा है, लेकिन वर्तमान तरीके एक अनाड़ी लाइब्रेरियन की तरह हैं जो सबसे महत्वपूर्ण सुरक्षा नियमों को पहले फेंक देता है। इससे AI अपने निर्देशों को भूल जाता है और गुप्त बातें लीक कर देता है। समाधान यह है कि "फेंकने" की प्रक्रिया को निष्पक्ष बनाया जाए, यह सुनिश्चित किया जाए कि किसी एक निर्देश को हटाने के लिए गलत तरीके से निशाना न बनाया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →