Not All Tokens Are Worth Caching: Learning Semantic-Aware Eviction for LLM Prefix Caches
تقدم هذه الورقة SAECache، وهي سياسة طرد ذاكرة مؤقتة دلالية متكيفة تستفيد من قيم إعادة الاستخدام المتفاوتة لأنواع الرموز المختلفة من خلال بنية متعددة الطوابير والتعلم عبر الإنترنت لتحسين كفاءة خدمة النماذج اللغوية الكبيرة بشكل كبير مع القضاء على الحاجة إلى الضبط اليدوي للمعلمات.