VQKV: High-Fidelity and High-Ratio Cache Compression via Vector-Quantization
VQKV एक नवीन, प्रशिक्षण-मुक्त विधि है जो लार्ज लैंग्वेज मॉडल्स में की-वैल्यू (Key-Value) कैश को कंप्रेस करने के लिए वेक्टर क्वांटाइजेशन का लाभ उठाती है, जो LLaMA3.1-8B पर 82.8% कंप्रेशन अनुपात प्राप्त करते हुए बेसलाइन प्रदर्शन का 98.6% बनाए रखती है और 4.3 गुना लंबी जनरेशन लंबाई सक्षम करती है।