CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM
تُعد استراتيجية CONF-KV طريقة مبتكرة لإخلاء ذاكرة التخزين المؤقت لـ KV، حيث تقوم بتعديل ميزانيات التخزين المؤقت ديناميكيًا بناءً على ثقة النموذج في التنبؤ لكل خطوة، وتستخدم تخزينًا بدقة مختلطة لتقليل استخدام الذاكرة بشكل كبير مع الحفاظ على دقة استرجاع عالية وأداء المهام للاستنتاج طويل الأمد في النماذج اللغوية الكبيرة.