← नवीनतम पेपर
💻 computer science

VeriCache: Turning Lossy KV Cache into Lossless LLM Inference

VeriCache एक इन्फरेंस फ्रेमवर्क है जो कंप्रेस्ड KV-कैश का उपयोग करके टोकन ड्राफ्ट करने और उन्हें फुल कैश के विरुद्ध सत्यापित करने के माध्यम से लॉसलेस (lossless) LLM आउटपुट प्राप्त करता है जो फुल-KV-कैश डिकोडिंग के समान होता है, जबकि यह थ्रूपुट को महत्वपूर्ण रूप से बढ़ाता है क्योंकि फुल कैश को GPU मेमोरी से बाहर रखा जाता है और केवल आवश्यकता होने पर ही स्वैप किया जाता है।

मूल लेखक: Jiayi Yao, Samuel Shen, Kuntai Du, Shaoting Feng, Dongjoo Seo, Rui Zhang, Yuyang Huang, Yuhan Liu, Shan Lu, Junchen Jiang

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiayi Yao, Samuel Shen, Kuntai Du, Shaoting Feng, Dongjoo Seo, Rui Zhang, Yuyang Huang, Yuhan Liu, Shan Lu, Junchen Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ VeriCache पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करते हुए स्पष्टीकरण दिया गया है।

बड़ी समस्या: "मेमोरी ओवरलोड" (Memory Overload)

कल्पना कीजिए कि एक सुपर-स्मार्ट AI असिस्टेंट (एक लार्ज लैंग्वेज मॉडल) को आपके सवालों के जवाब देने के लिए भारी मात्रा में जानकारी याद रखने की ज़रूरत है। यह जानकारी एक विशेष "रफ नोटपैड" में स्टोर होती है जिसे KV Cache कहा जाता है।

जैसे-जैसे बातचीत लंबी होती जाती है (जैसे कि पूरी किताब लिखना या किसी विशाल कोडबेस का विश्लेषण करना), यह रफ नोटपैड इतना बड़ा हो जाता है कि यह AI की तेज़ और महंगी मेमोरी (GPU) में फिट नहीं हो पाता।

  • पुराना समाधान: इसे फिट करने के लिए, इंजीनियरों ने इस रफ नोटपैड को "कंप्रेस" (छोटा) करना शुरू कर दिया। उन्होंने कुछ विवरण हटा दिए या संख्याओं को सरल बना दिया (जैसे कि 100 पन्नों की रिपोर्ट को 10 पन्नों के सारांश में बदल देना)।
  • नुकसान: यह कंप्रेशन लॉसी (lossy) होता है। यह वैसा ही है जैसे किसी धुंधले नक्शे (blurry map) का उपयोग करके कार चलाने की कोशिश करना। छोटे रास्तों के लिए यह ठीक है। लेकिन लंबी यात्राओं के लिए (जैसे कोड लिखना या टूल्स का उपयोग करना), AI छोटी-छोटी गलतियाँ करने लगता है। ये गलतियाँ जमा होती रहती हैं, और अंततः AI ऐसा कोड लिख सकता है जो क्रैश हो जाए या गलत उत्तर दे, भले ही शब्द देखने में सही लग रहे हों।

नया समाधान: VeriCache

शोधकर्ताओं ने VeriCache बनाया है, जो एक ऐसा सिस्टम है जो आपको गति के लिए "धुंधले नक्शे" (कंप्रेस्ड कैश) का उपयोग करने देता है, लेकिन यह सुनिश्चित करने के लिए कि आप रास्ता न भटकें, यह "असली नक्शे" (फुल कैश) की जाँच भी करता है।

इसे एक तेज़ ड्राफ्ट्समैन (Draftsman) और एक सख्त संपादक (Editor) के रूप में सोचें।

यह कैसे काम करता है (उपमा)

  1. ड्राफ्ट्समैन (Compressed Cache):
    AI एक छोटे, तेज़ और कंप्रेस्ड मेमोरी का उपयोग करके एक साथ कई वाक्य (टोकन) तेज़ी से लिखने के लिए करता है। यह बहुत तेज़ है क्योंकि मेमोरी छोटी है और कंप्यूटर पर आसानी से फिट हो जाती है।

    • उपमा: एक तेज़ लिखने वाला छात्र जो एक त्वरित सारांश के आधार पर अगले कुछ शब्दों का अनुमान लगाता है।
  2. सख्त संपादक (Full Cache):
    छात्र का काम आपको भेजने से पहले, एक "सख्त संपादक" इसकी जाँच करता है। संपादक के पास पूरी मूल, सटीक मेमोरी तक पहुँच होती है (जो इतनी बड़ी है कि उसे हर समय डेस्क पर नहीं रखा जा सकता, इसलिए उसे कमरे के दूसरे कोने में एक फाइलिंग कैबिनेट में रखा गया है)।

    • ट्रिक: संपादक भारी फाइलिंग कैबिनेट से फाइल निकालने के लिए तभी आता है जब उन्हें शब्दों के एक बैच की जाँच करनी होती है।
  3. "स्टैगर्ड" डांस (The Secret Sauce):
    यहीं पर VeriCache चतुर बनता है। आमतौर पर, यदि आपको भारी फाइल लेने के लिए रुकना पड़ता है, तो सब कुछ रुक जाता है।

    • VeriCache का तरीका: जब संपादक भारी फाइल लेने के लिए फाइलिंग कैबिनेट की ओर जा रहा होता है, तब छात्र लिखना जारी रखता है!
    • क्योंकि डेटा को स्टोरेज से मेमोरी में ले जाना (fetching) और अगला वाक्य लिखना (GPU का उपयोग करना) कंप्यूटर के अलग-अलग "रास्तों" का उपयोग करते हैं, वे एक-दूसरे से टकराए बिना एक साथ हो सकते हैं।
    • जब तक संपादक फाइल लेकर वापस आता है, तब तक छात्र एक पूरा नया पैराग्राफ लिख चुका होता है। संपादक पिछले पैराग्राफ की जाँच करता है, गलतियों को सुधारता है, और बाकी हिस्से को मंजूरी देता है।

यह एक बड़ी बात क्यों है?

  • लॉसलेस स्पीड (Lossless Speed): पिछले तरीकों ने आपको एक विकल्प चुनने पर मजबूर किया था: तेज़ लेकिन गलत (कंप्रेस्ड) या धीमा लेकिन सटीक (फुल)। VeriCache आपको तेज़ और सटीक दोनों देता है। अंतिम आउटपुट बिल्कुल वैसा ही होता है जैसा आपको तब मिलता जब आप पूरे समय धीमी, फुल मेमोरी का उपयोग कर रहे होते।
  • कोई "साइलेंट फेलियर" नहीं: कोडिंग या विशिष्ट कमांड देने जैसे कार्यों में, एक छोटी सी गलती भी आपदा बन सकती है। VeriCache इन गलतियों को आपके पास पहुँचने से पहले ही पकड़ लेता है।
  • किसी भी चीज़ के साथ काम करता है: इसे इस बात से फर्क नहीं पड़ता कि मेमोरी को कैसे कंप्रेस किया गया था। चाहे उन्होंने शब्द हटा दिए हों या संख्याओं को सरल बनाया हो, VeriCache उस कंप्रेस्ड वर्जन को "ड्राफ्ट्समैन" के रूप में और फुल वर्जन को सत्यापन के लिए उपयोग कर सकता है।

परिणाम

अपने परीक्षणों में, VeriCache पूरी, धीमी मेमोरी का उपयोग करने की तुलना में 4 गुना अधिक तेज़ टेक्स्ट जेनरेट करने में सक्षम रहा, जबकि इसने बिल्कुल वही सही परिणाम दिए।

संक्षेप में: VeriCache AI को एक तेज़, हल्के ट्रैक पर चलने देता है, लेकिन बैकग्राउंड में सुरक्षा रेल (safety rails) लगा देता है जो भारी, सटीक ट्रैक की जाँच करती हैं, जिससे यह सुनिश्चित होता है कि AI कभी भी पटरी से न उतरे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →