← नवीनतम पेपर
🤖 machine learning

PolyKV: Heterogeneous Retention and Allocation for KV Cache Compression

PolyKV एक लेयर-वार (layer-wise) KV कैश अनुकूलन ढांचा है जो प्रत्येक ट्रांसफॉर्मर लेयर को सबसे उपयुक्त संपीड़न नीति (compression policy) में गतिशील रूप से रूट करके और गैर-समान (non-uniform) कैश बजट आवंटित करके लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस में सुधार करता है, जिससे यह मौजूदा समान एकल-नीति बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Chao Fei, Panos Kalnis

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chao Fei, Panos Kalnis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी कहानी को याद रखने की कोशिश कर रहे हैं ताकि बाद में उसके बारे में सवालों के जवाब दे सकें। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इस "याददाश्त" को KV Cache कहा जाता है। जैसे-जैसे कहानी लंबी होती जाती है, यह मेमोरी कंप्यूटर की हार्ड ड्राइव पर बहुत अधिक जगह घेर लेती है, जिससे सब कुछ धीमा हो जाता है।

इसे ठीक करने के लिए, वैज्ञानिक आमतौर पर एक "कचरे के डिब्बे" (trash can) की रणनीति का उपयोग करते हैं: वे कहानी के उन हिस्सों को फेंक देते हैं जो उन्हें लगता है कि महत्वपूर्ण नहीं हैं ताकि जगह बचाई जा सके। हालाँकि, अधिकांश AI मॉडल अपने मस्तिष्क के हर हिस्से के लिए एक ही कचरे के डिब्बे के नियम का उपयोग करते हैं। वे मान लेते हैं कि कहानी की शुरुआत को संभालने वाले मस्तिष्क के हिस्से को ठीक उसी तरह से व्यवहार करने की आवश्यकता है जैसे कि बीच या अंत को संभालने वाले हिस्से को।

"PolyKV" नामक शोध पत्र तर्क देता है कि यह एक सूटकेस पैक करने जैसा है जहाँ आप हर कम्पार्टमेंट से एक ही प्रकार की चीज़ (जैसे, सभी मोज़े) फेंक देते हैं, चाहे उस कम्पार्टमेंट के अंदर वास्तव में क्या हो। यह बहुत कठोर है।

यहाँ बताया गया है कि PolyKV सरल उपमाओं (analogies) का उपयोग करके खेल को कैसे बदल देता है:

1. समस्या: एक आकार सबके लिए उपयुक्त नहीं है (One Size Does Not Fit All)

एक AI मॉडल को एक कहानी को समझने के लिए मिलकर काम करने वाले 30 अलग-अलग विशेषज्ञों की एक टीम के रूप में सोचें।

  • विशेषज्ञ A (लेयर 1) पात्रों के नाम याद रखने में माहिर हो सकता है।
  • विशेषज्ञ B (लेयर 15) भावनात्मक स्वर (emotional tone) को समझने में माहिर हो सकता है।
  • विशेषज्ञ C (लेयर 30) अगला शब्द अनुमान लगाने में माहिर हो सकता है।

वर्तमान में, अधिकांश AI मॉडल सभी 30 विशेषज्ञों को कहते हैं: "आप अपने नोटबुक में केवल 5 नोट्स रख सकते हैं।" यह "यूनिफॉर्म बजट" (Uniform Budget) है।

  • विशेषज्ञ A को अपना काम अच्छी तरह से करने के लिए 20 नोट्स की आवश्यकता हो सकती है।
  • विशेषज्ञ C को केवल 2 नोट्स की आवश्यकता हो सकती है।
  • सबको 5 रखने के लिए मजबूर करके, विशेषज्ञ A अभिभूत (overwhelmed) हो जाता है (और गलतियाँ करता है), जबकि विशेषज्ञ C के पास खाली जगह होती है जिसका वह उपयोग नहीं कर रहा है।

2. समाधान: PolyKV (एक स्मार्ट मैनेजर)

PolyKV एक स्मार्ट मैनेजर पेश करता है जो काम शुरू होने से पहले प्रत्येक विशेषज्ञ को व्यक्तिगत रूप से देखता है। यह प्रत्येक विशेषज्ञ के लिए दो विशिष्ट निर्णय लेता है:

  • निर्णय A: क्या फेंक दिया जाए? (The Eviction Pattern)

    • विशेषज्ञ A को शायद शुरुआती कुछ वाक्यों और आखिरी कुछ वाक्यों को रखना पड़ सकता है।
    • विशेषज्ञ B को शायद सबसे लोकप्रिय वाक्यों (भारी हिटर्स) को रखना पड़ सकता है।
    • PolyKV प्रत्येक विशेषज्ञ से पूछता है: "आपको किस प्रकार के नोट्स पर सबसे अधिक भरोसा है?" और उन्हें यह तय करने के लिए एक कस्टम नियम देता है कि क्या रखना है।
  • निर्णय B: कितनी जगह दी जाए? (The Budget)

    • यदि विशेषज्ञ A जानकारी खोने के प्रति बहुत संवेदनशील है, तो PolyKV उन्हें एक बड़ी नोटबुक देता है।
    • यदि विशेषज्ञ C मजबूत है और उसे बहुत कम आवश्यकता है, तो PolyKV उन्हें एक छोटा नोटपैड देता है।
    • सभी नोटबुक्स का कुल आकार समान रहता है, लेकिन वितरण आवश्यकता के आधार पर निष्पक्ष होता है।

3. यह कैसे काम करता है: "रिहर्सल" (Offline Calibration)

आप पूछ सकते हैं, "मैनेजर को वास्तविक काम शुरू होने से पहले प्रत्येक विशेषज्ञ की आवश्यकता का पता कैसे चलता है बिना काम को धीमा किए?"

PolyKV वास्तविक काम शुरू होने से पहले टेक्स्ट के एक छोटे नमूने पर एक त्वरित रिहर्सल (जिसे "ऑफलाइन कैलिब्रेशन" कहा जाता है) करता है।

  • यह देखता है कि जानकारी हटाए जाने पर प्रत्येक विशेषज्ञ कैसे प्रतिक्रिया देता है।
  • यह सीखता है: "ओह, विशेषज्ञ A भ्रमित हो जाता है यदि हम शुरुआत हटा देते हैं, लेकिन विशेषज्ञ B को इससे फर्क नहीं पड़ता।"
  • यह इस रिहर्सल के आधार पर एक निश्चित योजना लिख देता है।
  • जब वास्तविक काम शुरू होता है, तो मैनेजर बस उस योजना का पालन करता है। वास्तविक बातचीत के दौरान किसी भी तरह के सोचने की आवश्यकता नहीं होती है, इसलिए यह तेज़ रहता है।

4. परिणाम: बेहतर मेमोरी, समान स्थान

शोधकर्ताओं ने दो लोकप्रिय AI मॉडल (LLaMA और Qwen) पर एक मानक मेमोरी सीमा का उपयोग करके इसका परीक्षण किया।

  • पुराना तरीका: सभी के लिए एक ही नियम का उपयोग करके, AI ने एक लंबी कहानी परीक्षण पर लगभग 36.35 का स्कोर प्राप्त किया।
  • PolyKV का तरीका: प्रत्येक विशेषज्ञ के लिए नियमों और नोटबुक के आकार को अनुकूलित करके, स्कोर बढ़कर 37.79 हो गया।

यह सुनने में छोटा लग सकता है, लेकिन AI की दुनिया में, यह एक बड़ी जीत है। इसका मतलब है कि PolyKV ने "कचरा फेंकने" वाले तरीके और "परफेक्ट मेमोरी" वाले तरीके (जो व्यावहारिक होने के लिए बहुत अधिक जगह का उपयोग करता है) के बीच के प्रदर्शन अंतर को 54.5% तक कवर कर लिया है।

5. जहाँ यह चमकता है और जहाँ इसे संघर्ष करना पड़ता है

  • जीत: PolyKV उन कार्यों में अद्भुत है जिनमें बड़ी तस्वीर या संदर्भ (context) को समझने की आवश्यकता होती है, जैसे कि लंबे दस्तावेज़ के बारे में प्रश्न पूछना या कहानी का सारांश देना। यह जानता है कि मस्तिष्क के प्रत्येक भाग के लिए "महत्वपूर्ण" हिस्सों को कैसे रखना है।
  • सीमा: यह कभी-कभी "नीडल इन अ हेस्टैक" (Needle in a Haystack) कार्यों (एक विशाल टेक्स्ट में एक विशिष्ट, छोटी तथ्य को खोजना) या कोडिंग कार्यों में संघर्ष करता है। यह सुझाव देता है कि हालांकि PolyKV सामान्य समझ के लिए बहुत अच्छा है, लेकिन कभी-कभी यह एक विशिष्ट "सुई" को फेंक देता है जिसे रिहर्सल के दौरान एक विशेषज्ञ ने महत्वहीन समझा था लेकिन बाद में वह महत्वपूर्ण साबित हुआ।

सारांश

PolyKV एक फैक्ट्री असेंबली लाइन से एक अनुकूलित वर्कशॉप (customized workshop) में अपग्रेड करने जैसा है जहाँ हर कर्मचारी को उनके विशिष्ट कार्य को करने के लिए विशिष्ट उपकरण और डेस्क मिलते हैं। ऐसा करके, पूरी टीम बेहतर काम करती है, अधिक याद रखती है, और एक ही कुल कमरे के आकार के भीतर फिट बैठती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →