KV Cache Offloading for Context-Intensive Tasks
यह शोध पत्र प्रकट करता है कि मौजूदा KV-कैश ऑफलोडिंग विधियाँ लो-रैंक प्रोजेक्शन और अविश्वसनीय लैंडमार्क्स के कारण नए पेश किए गए Text2JSON बेंचमार्क जैसे संदर्भ-गहन कार्यों पर प्रदर्शन को काफी कम कर देती हैं, और एक सरल वैकल्पिक रणनीति का प्रस्ताव करता है जो कई LLM परिवारों में सटीकता में पर्याप्त सुधार करती है।