VeriCache: Turning Lossy KV Cache into Lossless LLM Inference
VeriCache एक इन्फरेंस फ्रेमवर्क है जो कंप्रेस्ड KV-कैश का उपयोग करके टोकन ड्राफ्ट करने और उन्हें फुल कैश के विरुद्ध सत्यापित करने के माध्यम से लॉसलेस (lossless) LLM आउटपुट प्राप्त करता है जो फुल-KV-कैश डिकोडिंग के समान होता है, जबकि यह थ्रूपुट को महत्वपूर्ण रूप से बढ़ाता है क्योंकि फुल कैश को GPU मेमोरी से बाहर रखा जाता है और केवल आवश्यकता होने पर ही स्वैप किया जाता है।