← नवीनतम पेपर
💬 NLP

CentroidKV: Efficient Long-Context LLM Inference via KV Cache Clustering

CentroidKV एक सरल लेकिन प्रभावी फ्रेमवर्क है जो चंक्ड सॉफ्ट मैचिंग (chunked soft matching) और सेंट्रॉइड मर्जिंग (centroid merging) का उपयोग करने वाले ऑनलाइन KV कैश क्लस्टरिंग दृष्टिकोण के माध्यम से लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस मेमोरी उपयोग को 75% तक कम करता है और डिकोडिंग को 1.92x तक तेज करता है।

मूल लेखक: Jie Hu, Shengnan Wang, Yutong He, Ping Gong, Jiawei Yi, Juncheng Zhang, Youhui Bai, Renhai Chen, Gong Zhang, Cheng Li, Kun Yuan

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jie Hu, Shengnan Wang, Yutong He, Ping Gong, Jiawei Yi, Juncheng Zhang, Youhui Bai, Renhai Chen, Gong Zhang, Cheng Li, Kun Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही महत्वपूर्ण सवाल का जवाब पाने के लिए एक विशाल, 1,00,000 पन्नों के उपन्यास को पढ़ने की कोशिश कर रहे हैं, जो कि बिल्कुल पहले वाक्य के बारे में है। जैसे-जैसे आप पढ़ते हैं, आपका मस्तिष्क स्वाभाविक रूप से हर पात्र, हर सेटिंग और हर कथानक (plot point) को याद रखने की कोशिश करता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस "याददाश्त" को KV Cache कहा जाता है।

समस्या क्या है? जैसे-जैसे कहानी लंबी होती जाती है, यह मेमोरी इतनी विशाल हो जाती है कि यह कंप्यूटर के मस्तिष्क (GPU) को क्रैश कर देती है, जिससे सब कुछ बहुत धीमा हो जाता है। यह एक मैराथन दौड़ते समय अपने बैकपैक में एक पूरी लाइब्रेरी ले जाने जैसा है।

मौजूदा समाधान इसे ठीक करने की कोशिश करते हैं या तो:

  1. पन्ने फेंक देते हैं: वे कहानी के उन हिस्सों को हटा देते हैं जिन्हें वे महत्वहीन समझते हैं। लेकिन कभी-कभी, 50 पन्ने पहले का एक "बोरिंग" पन्ना अंत की कुंजी हो सकता है, जिससे AI भ्रमित हो जाता है।
  2. फॉन्ट छोटा कर देते हैं: वे टेक्स्ट को कंप्रेस (compress) कर देते हैं, लेकिन इससे अक्सर पढ़ना कठिन हो जाता है और पढ़ने की गति धीमी हो जाती है।

CentroidKV इस मेमोरी को संभालने का एक नया, स्मार्ट तरीका है। आइए समझते हैं कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करके:

1. "ग्रुप हग" रणनीति (Clustering)

पन्ने हटाने या टेक्स्ट छोटा करने के बजाय, CentroidKV डुप्लिकेट्स (duplicates) को ढूंढता है।

कल्पना कीजिए कि आप 10,000 मेहमानों के साथ एक विशाल पार्टी आयोजित कर रहे हैं। कई मेहमानों ने बिल्कुल एक जैसी लाल शर्ट पहनी है और उनके बाल भी एक जैसे हैं। हर व्यक्ति को व्यक्तिगत रूप से याद रखने के बजाय, CentroidKV कहता है, "अरे, ये 50 लोग मूल रूप से एक जैसे हैं। आइए उन्हें एक साथ समूह में रखें और उन सभी का प्रतिनिधित्व करने के लिए एक 'सुपर-गेस्ट' (centroid) बनाएं।"

  • यह कैसे काम करता है: AI कहानी को स्कैन करता है और देखता है कि कुछ शब्द या वाक्यांश बहुत समान तरीकों से दिखाई देते हैं। यह इन समान "टोकन" (शब्दों) को एक साथ समूह में रखता है और पूरे समूह को उनके एक एकल, औसत संस्करण (averaged version) से बदल देता है।
  • परिणाम: आप 10,000 व्यक्तिगत मेहमानों को याद रखने के बजाय केवल कुछ सौ "सुपर-गेस्ट्स" को याद रखते हैं। यह मुख्य कहानी को खोए बिना मेमोरी के आकार को 75% तक कम कर देता है।

2. "चंक्ड" दृष्टिकोण (Chunked Soft Matching)

आप पूछ सकते हैं: "यदि मेरे पास 1,00,000 पन्ने हैं, तो आप उन्हें पढ़ने में बहुत अधिक समय लिए बिना डुप्लिकेट्स कैसे ढूंढते हैं?"

यदि आप हर पन्ने की हर दूसरे पन्ने से तुलना करने की कोशिश करते, तो इसमें बहुत समय लगता। CentroidKV एक चतुर तकनीक का उपयोग करता है जिसे Chunked Soft Matching कहा जाता है।

  • उपमा: कल्पना कीजिए कि आप कपड़ों के ढेर को छाँट रहे हैं। पूरे घर के हर मोज़े की तुलना हर दूसरे मोज़े से करने के बजाय, आप लॉन्ड्री को छोटे बक्सों (chunks) में विभाजित करते हैं।
  • रणनीति: प्रत्येक बक्से के अंदर, AI उन मोज़ों को ढूंढता है जो मेल खाते हैं। यह उन्हें जल्दी से जोड़ने के लिए एक विशेष "अल्टरनेटिंग" (alternating) विधि का उपयोग करता है। यह कुछ ऐसा है जैसे कहना, "इस टोकरी में, आइए लाल मोज़ों को नीले मोज़ों के साथ जोड़ें, लेकिन केवल तभी जब वे बहुत समान हों।"
  • यह तेज़ क्यों है: समस्या को छोटे, प्रबंधनीय टुकड़ों (chunks) में तोड़कर, AI इस ग्रुपिंग को तुरंत कर सकता है, भले ही कहानियाँ बहुत लंबी क्यों न हों।

3. "क्वालिटी कंट्रोल" फ़िल्टर

पेपर नोट करता है कि आप किसी भी दो चीजों को बस यूँ ही आपस में नहीं मिला सकते, अन्यथा आप महत्वपूर्ण विवरण खो देंगे।

  • उपमा: कल्पना कीजिए कि आप लोगों के एक समूह को मिला रहे हैं। आप एक शेफ को पायलट के साथ केवल इसलिए नहीं मिलाएंगे क्योंकि दोनों ने टोपी पहनी है। आप केवल उन लोगों को मिलाते हैं जो वास्तव में समान हैं।
  • प्रक्रिया: CentroidKV बहुत चूजी (picky) है। यह केवल उन समूहों को मर्ज करता है जो बहुत, बहुत समान होते हैं (उच्च विश्वास/high confidence)। यदि दो चीजें केवल "कुछ हद तक" समान हैं, तो यह उन्हें अकेला छोड़ देता है। यह आगे बढ़ते हुए और भी सख्त होता जाता है, यह सुनिश्चित करता है कि अंतिम "सुपर-गेस्ट्स" मूल समूह का सटीक प्रतिनिधित्व हैं।

परिणाम: तेज़ और हल्का

क्योंकि अब AI को बहुत छोटा "बैकपैक" (कंप्रेस्ड मेमोरी) ले जाना पड़ता है:

  • यह तेज़ी से पढ़ता है: इसकी "डिकोडिंग" गति (अगला शब्द बनाना) 1.92 गुना तक तेज़ है।
  • यह अधिक लोगों को संभालता है: सिस्टम एक ही समय में 4 गुना अधिक उपयोगकर्ताओं को सेवा दे सकता है क्योंकि यह मेमोरी की कमी का सामना नहीं करता है।
  • यह भूलता नहीं है: मेमोरी को सिकोड़ने के बावजूद, AI लगभग उतना ही अच्छा जवाब देता है जितना कि पूर्ण, अनकंप्रेस्ड मेमोरी के साथ।

यह क्या नहीं करता (सीमाएं)

पेपर ईमानदारी से बताता है कि यह विधि क्या नहीं करती है:

  • यह हर चीज़ के लिए जादू नहीं है: यदि कहानी बहुत विशिष्ट, रैंडम कोड्स (जैसे एक अद्वितीय ID नंबर जो केवल एक बार दिखाई देता है) पर निर्भर करती है, तो AI उस सटीक विवरण को बनाए रखने में संघर्ष कर सकता है क्योंकि यह समान चीजों को समूह में डाल देता है। यह कहानियों और अर्थों के लिए बहुत अच्छा है, लेकिन सटीक, रैंडम स्ट्रिंग्स को खोजने के लिए उतना परफेक्ट नहीं है।
  • यह GPU पर ही रहता है: वर्तमान में, यह ग्रुपिंग कंप्यूटर के मुख्य प्रोसेसर पर होती है। लेखक सुझाव देते हैं कि भविष्य में, हम इस ग्रुपिंग को एक धीमे, सस्ते प्रोसेसर (CPU) पर कर सकते हैं और परिणाम को मुख्य प्रोसेसर को भेज सकते हैं, लेकिन उन्होंने अभी तक इसे बनाया नहीं है।

संक्षेप में: CentroidKV एक स्मार्ट लाइब्रेरियन की तरह है जिसे एहसास होता है कि एक विशाल लाइब्रेरी में कई किताबें वास्तव में एक ही कहानी के पुनर्मुद्रण (reprints) हैं। 1,000 कॉपियां रखने के बजाय, वे एक "मास्टर कॉपी" रखते हैं और एक नोट लिखते हैं, "यह 1,000 किताबों का प्रतिनिधित्व करता है।" यह स्थान बचाता है, खोज को तेज़ करता है, और कहानी को बरकरार रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →