← नवीनतम पेपर
💬 NLP

SemantiCache: Efficient KV Cache Compression via Semantic Chunking and Clustered Merging

SemantiCache एक नवीन KV कैश संपीड़न ढांचा (framework) है जो कैश को सुसंगत चंक्स में विभाजित करके और ग्रीडी क्लस्टरिंग (greedy clustering) एवं आनुपातिक अटेंशन (proportional attention) के माध्यम से टोकन को मर्ज करके सिमेंटिक अखंडता को बनाए रखता है, जिससे मॉडल के प्रदर्शन से समझौता किए बिना 2.61x तक तेज़ डिकोडिंग और कम मेमोरी उपयोग प्राप्त होता है।

मूल लेखक: Shunlong Wu, Hai Lin, Shaoshen Chen, Tingwei Lu, Yongqin Zeng, Shaoxiong Zhan, Hai-Tao Zheng, Hong-Gee Kim

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shunlong Wu, Hai Lin, Shaoshen Chen, Tingwei Lu, Yongqin Zeng, Shaoxiong Zhan, Hai-Tao Zheng, Hong-Gee Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप बाद में एक दोस्त को सुनाने के लिए एक बहुत लंबी कहानी याद रखने की कोशिश कर रहे हैं।

समस्या: स्मृति की "ईंट की दीवार" (The "Brick Wall" of Memory)
लार्ज लैंग्वेज मॉडल्स (LLMs) सुपर-स्मार्ट कहानीकारों की तरह होते हैं, लेकिन उनकी एक मेमोरी संबंधी समस्या है। जैसे-जैसे वे एक लंबी कहानी पढ़ते हैं, वे अब तक देखे गए हर एक शब्द का एक "रफ नोट" (जिसे KV Cache कहा जाता है) रखते हैं ताकि वे संदर्भ (context) को समझ सकें।

समस्या यह है कि यह रफ नोट कहानी के आकार के साथ बढ़ता जाता है। यदि कहानी 1,00,000 शब्दों की है, तो रफ नोट बहुत बड़ा हो जाता है। इसमें बहुत अधिक कंप्यूटर मेमोरी लगती है (जैसे अपने बैकपैक में पूरी लाइब्रेरी ले जाने की कोशिश करना) और यह कंप्यूटर को धीमा बना देता है क्योंकि उसे जो कुछ भी चाहिए उसे खोजने के लिए हर एक पन्ने को पलटना पड़ता है।

पुराने समाधान: चीजों को फेंक देना या उन्हें कुचल देना
इसे ठीक करने के लिए, पिछले तरीकों ने दो चीजें आजमाईं:

  1. चीजों को फेंक देना: वे उन शब्दों को हटा देते थे जिन्हें वे "महत्वहीन" समझते थे। लेकिन यह एक फिल्म को केवल धमाकों को रखकर और संवादों को हटाकर याद रखने की कोशिश करने जैसा है। इससे आप कहानी का सार खो देते हैं।
  2. चीजों को आपस में कुचल देना: वे शब्दों के यादृच्छिक (random) समूहों को लेते थे और उन्हें एक "सुपर-वर्ड" में औसत (average) निकाल देते थे। लेकिन यदि आप "सेब खाने" के वाक्य को "कार चलाने" के वाक्य के साथ औसत निकाल देते हैं, तो आपको बकवास प्राप्त होती है। इसे सिमेंटिक फ्रैगमेंटेशन (semantic fragmentation) कहा जाता है—अर्थात अर्थ को टुकड़ों में तोड़ देना।

नया समाधान: SemantiCache (एक "स्मार्ट सारांशकर्ता")
यह पेपर SemantiCache पेश करता है, जो एक नया तरीका है जिससे इस स्मृति को संकुचित किया जा सकता है, जबकि यह कहानी के अर्थ का सम्मान करता है। यह एक इंसान की तरह काम करता है जो किताब पढ़ रहा है और स्मार्ट नोट्स बना रहा है।

यह कैसे काम करता है, लाइब्रेरी एनालॉजी (Library Analogy) का उपयोग करके चरण-दर-चरण यहाँ दिया गया है:

चरण 1: सिमेंटिक चंकिंग (अध्यायों के अनुसार व्यवस्थित करना)

कहानी को शब्दों के एक यादृच्छिक प्रवाह के रूप में देखने के बजाय, SemantiCache प्राकृतिक विभाजनों को ढूंढता है, जैसे पूर्ण विराम (periods), अल्पविराम (commas), या नई लाइनें।

  • एनालॉजी: कल्पना करें कि बिखरे हुए पन्नों का एक ढेर है। यादृच्छिक पन्ने उठाने के बजाय, आप पहले उन्हें अध्यायों या अनुच्छेदों में व्यवस्थित करते हैं। आप "अध्याय शुरू" के मार्करों (delimiters) को सुरक्षित और अछूता रखते हैं। यह सुनिश्चित करता है कि आप कभी भी किसी वाक्य को बीच में से न तोड़ें।

चरण 2: ग्रीडी सीड क्लस्टरिंग (समान विचारों को समूहबद्ध करना)

प्रत्येक अध्याय के भीतर, कई शब्द हो सकते हैं जो एक ही बात कहते हैं।

  • एनालॉजी: कल्पना करें कि "पिकनिक" के बारे में एक अध्याय है। इसमें "सैंडविच", "हैम", "टर्की", "ब्रेड" और "लंच" का उल्लेख है।
    • पुराने तरीके शायद "सैंडविच" को अगले अध्याय के "बारिश" वाले शब्द के साथ मिला देते।
    • SemantiCache शब्दों को देखता है और कहता है, "हे, 'सैंडविच', 'हैम' और 'ब्रेड' सभी एक ही अवधारणा के बारे में बात कर रहे हैं।" यह उन्हें एक क्लस्टर (cluster) में समूहबद्ध करता है। यह इसे तेजी से और कुशलता से करता है, जैसे एक लाइब्रेरियन विषयों के आधार पर किताबों को जल्दी से छाँटता है।

चरण 3: क्लस्टर्ड मर्जिंग (मुख्य सारांश बनाना)

अब, "पिकनिक" क्लस्टर के प्रत्येक शब्द को अलग से याद रखने के बजाय, मॉडल एक एकल सिमेंटिक कोर (Semantic Core) बनाता है।

  • एनालॉजी: "सैंडविच", "हैम", "टर्की" और "ब्रेड" को अलग-अलग याद रखने के बजाय, मॉडल एक शक्तिशाली नोट बनाता है जो कहता है: "पिकनिक फूड"
    • यह "मर्जिंग" (विलय) वाला हिस्सा है। यह 4 शब्दों को 1 "सुपर-वर्ड" में संकुचित कर देता है।

गुप्त नुस्खा: प्रोपोर्शनल अटेंशन (सही वजन देना)

यहाँ पेचीदा हिस्सा है। यदि आप 4 शब्दों को 1 शब्द में बदलते हैं, तो वह एक शब्द कंप्यूटर के लिए कम महत्वपूर्ण लग सकता है।

  • एनालॉजी: कल्पना करें कि 4 लोग "आग!" चिल्ला रहे हैं। यदि आप उन्हें 1 व्यक्ति द्वारा "आग!" चिल्लाने से बदल देते हैं, तो कंप्यूटर सोच सकता है, "ओह, केवल एक व्यक्ति चिल्ला रहा है, तो यह कोई बड़ी बात नहीं है।"
  • समाधान: SemantiCache एक विशेष "वॉल्यूम नॉब" (जिसे प्रोपोर्शनल अटेंशन कहा जाता है) जोड़ता है। यह कंप्यूटर को बताता है: "भले ही यह केवल एक नोट है, यह 4 लोगों का प्रतिनिधित्व करता है। इसलिए, वॉल्यूम बढ़ा दें!" यह सुनिश्चित करता है कि संकुचित स्मृति में मूल जानकारी का पूरा वजन बना रहे।

परिणाम

ऐसा करके, कंप्यूटर की स्मृति (रफ नोट) बहुत छोटी हो जाती है (जैसे एक लाइब्रेरी को कुछ इंडेक्स कार्ड में सिकोड़ देना), लेकिन अर्थ एकदम सटीक रहता है

  • गति (Speed): क्योंकि अब पन्ने पलटने के लिए कम मेमोरी है, कंप्यूटर बहुत तेज़ी से पढ़ और लिख सकता है (परीक्षणों में 2.6 गुना तेज़)।
  • सटीकता (Accuracy): क्योंकि इसने वाक्यों को तोड़ा नहीं या असंबंधित विचारों को मिलाया नहीं, मॉडल अभी भी प्रश्नों के सही उत्तर देता है, बिल्कुल मूल, बिना संकुचित किए गए मॉडल की तरह।

संक्षेप में:
SemantiCache एक स्मार्ट संपादक की तरह है जो केवल शब्दों को बेतरतीब ढंग से नहीं काटता है। इसके बजाय, वे कहानी को पढ़ते हैं, संबंधित विचारों को एक साथ समूहबद्ध करते हैं, उन समूहों का सारांश बनाते हैं, और यह सुनिश्चित करते हैं कि सारांश इतना तेज़ हो कि उसे सुना जा सके। यह AI को बिना "मूर्ख" बनाए इसे तेज़ और हल्का बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →