xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
تقدم الورقة البحثية xKV، وهي طريقة لما بعد التدريب تضغط ذاكرة KV-Cache بمقدار 8 أضعاف وتسرع الاستدلال بما يصل إلى 4.23 ضعفاً من خلال التحليل المشترك للمتجهات المفردة المتوافقة عبر الطبقات وإعادة البناء الانتقائي، مما يوفر حلاً جاهزاً للتشغيل (plug-and-play) لاستدلال النماذج اللغوية الكبيرة ذات السياق الطويل بكفاءة دون الحاجة إلى إعادة التدريب.