FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
يُعد FreeKV إطار عمل خالٍ من التدريب يجمع بين الاسترجاع التخميني، والتصحيح دقيق التفاصيل، وإدارة الذاكرة الهجينة بين المعالج المركزي ومعالج الرسوميات لتسريع استرجاع ذاكرة التخزين المؤقت (KV cache) للنماذج اللغوية الكبيرة بشكل كبير، محققاً تسريعاً يصل إلى 13 ضعفاً مقارنة بأحدث الطرق الحالية مع الحفاظ على دقة تقارب الدقة الأصلية.