EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
تقدم هذه الورقة البحثية EVA، وهي بنية معمارية محسنة مشتركاً بين الأجهزة والبرمجيات، تعمل على تسريع عملية فك ترميز النماذج اللغوية الكبيرة (LLM) عبر تحويل عمليات البحث في التكميم المتجهي المقيدة بالذاكرة إلى حسابات ضرب مصفوفات (GEMM) فعالة وخالية من التعارض، محققةً تسريعاً يصل إلى 11.17 ضعفاً وكفاءة طاقة أعلى بمقدار 7.17 ضعفاً مقارنةً بأحدث الأساليب الحالية.