← أحدث الأبحاث
🤖 machine learning

EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture

تقدم هذه الورقة البحثية EVA، وهي بنية معمارية محسنة مشتركاً بين الأجهزة والبرمجيات، تعمل على تسريع عملية فك ترميز النماذج اللغوية الكبيرة (LLM) عبر تحويل عمليات البحث في التكميم المتجهي المقيدة بالذاكرة إلى حسابات ضرب مصفوفات (GEMM) فعالة وخالية من التعارض، محققةً تسريعاً يصل إلى 11.17 ضعفاً وكفاءة طاقة أعلى بمقدار 7.17 ضعفاً مقارنةً بأحدث الأساليب الحالية.

المؤلفون الأصليون: Bowen Duan, Cong Guo, Chiyue Wei, Haoxuan Shan, Yuzhe Fu, Xinhua Chen, Yifan Xu, Ziyue Zhang, Changchun Zhou, Hai Li, Yiran Chen

نُشر 2026-05-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bowen Duan, Cong Guo, Chiyue Wei, Haoxuan Shan, Yuzhe Fu, Xinhua Chen, Yifan Xu, Ziyue Zhang, Changchun Zhou, Hai Li, Yiran Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة من المعرفة (نموذج لغوي كبير، أو LLM) يمكنها كتابة القصص، وحل المسائل الرياضية، والدردشة معك. لجعل هذه المكتبة تعمل، يجب على الكمبيوتر القيام بشيئين رئيسيين: القراءة (الاستيعاب المسبق - prefill) لكمية هائلة من النصوص دفعة واحدة، والكتابة كلمة بكلمة، مراراً وتكراراً (مرحلة فك التشفير - decoding).

تجادل الورقة البحثية بأنه بينما تكون القراءة سريعة، فإن كتابة كلمة واحدة في كل مرة هي عملية بطيئة للغاية ومبذرة للغاية على أجهزة الكمبيوتر الحالية. لقد قام المؤلفون، وهم فريق من جامعة ديوك، ببناء نظام جديد يسمى EVA لإصلاح ذلك.

إليك كيف يعمل EVA، مشروحاً من خلال تشبيهات بسيطة:

المشكلة: ازدحام المرور "كلمة واحدة في كل مرة"

فكر في عقل الكمبيوتر (المعالج) كأنه مصنع ضخم يحتوي على آلاف العمال (وحدات المعالجة) المستعدين للقيام بالعمليات الحسابية.

  1. مرحلة الاستيعاب المسبق (القراءة): تخيل أن المصنع يتلقى شحنة ضخمة من 1,000 صندوق. يمكن لجميع العمال التقاط صندوق والعمل عليه في وقت واحد. هذا سريع وفعال.
  2. مرحلة فك التشفير (الكتابة): الآن، تخيل أن المصنع يتعين عليه إنتاج عنصر واحد صغير فقط، ثم ينتظر، ثم ينتج عنصراً آخر، ثم ينتظر. على الرغم من أن المصنع يحتوي على آلاف العمال، إلا أن عاملاً واحداً أو اثنين فقط يكونان مشغولين في أي وقت. البقية يقفون دون فعل شيء. هذه هي مشكلة "GEMV" المذكورة في الورقة: الكمبيوتر مقيد بالذاكرة (ينتظر البيانات) بدلاً من أن يكون مقيداً بالحوسبة (القيام بالرياضيات)، مما يؤدي إلى ازدحام مروري هائل.

الحل القديم: اختناق "البحث في القاموس"

لجعل المصنع أسرع، حاول المهندسون تقليص "كتيب التعليمات" (أوزان النموذج) باستخدام تقنية تسمى تكميم المتجهات (Vector Quantization - VQ).

  • التشبيه: بدلاً من كتابة التعليمات الكاملة لكل كلمة، استبدلوا التعليمات الطويلة برموز قصيرة (مثل "A1"، "B2") تشير إلى قاموس مشترك (Codebook).
  • المشكلة الجديدة: بينما يقلص هذا حجم الكتيب، فإنه يخلق ازدحاماً مرورياً جديداً. في كل مرة يحتاج فيها المصنع لإنتاج كلمة، يتعين عليه الذهما إلى القاموس، والبحث عن الرمز، ثم جلب التعليمات.
  • الصراع: تخيل 100 عامل يركضون جميعاً إلى نفس الرف في القاموس في نفس اللحظة تماماً. يصطدمون ببعضهم البعض، مما يسبب صراعاً في الذاكرة. يتعين عليهم الانتظار في طابور، مما يبطئ كل شيء. تسمي الورقة هذا "عدم كفاءة الذاكرة".

حل EVA: تغيير سير العمل

أدرك مؤلفو EVA أنهم لا يحتاجون لتغيير القاموس؛ بل كانوا بحاجة لتغيير كيفية استخدام العمال له. لقد قدموا خدعة سحرية من خطوتين:

الخطوة 1: القيام بالرياضيات قبل البحث عن الرمز

بدلاً من البحث عن الرمز أولاً ثم القيام بالرياضيات، يقوم EVA بقلب السيناريو.

  • التشبيه: تخيل أن العمال لا ينتظرون القاموس. بدلاً من ذلك، يأخذون المدخلات (السؤال) ويقومون بتشغيلها مقابل القاموس بأكم له في وقت واحد.
  • النتيجة: هذا يحول مشكلة الرياضيات "واحدة تلو الأخرى" إلى مشكلة رياضيات "بمجموعات كبيرة". من الناحية التقنية، حولوا عملية GEMV (مصفوفة-متجه) بطيئة إلى عملية GEMM (مصفوفة-مصفوفة) سريعة. الآن، عمال المصنع جميعاً مشغولون مرة أخرى، يقومون بالرياضيات بالتوازي.

الخطوة 2: البحث "الخالي من الصراعات"

بمجرد الانتهاء من الرياضيات، يحصل العمال على قائمة من "النتائج الوسيطة" (Output Codebook).

  • التشبيه: في النظام القديم، كان الجميع يركضون إلى نفس الرف. في EVA، يتم فرز النتائج مسبقاً في حاويات مختلفة ومنفصلة. عندما يحتاج عامل إلى نتيجة محددة، يذهب إلى حاويته الخاصة. لا أحد يصطدم بالآخر.
  • النتيجة: يختفي "صراع الذاكرة" تماماً. يصبح البحث فورياً ومتوازياً.

الأجهزة: أرض مصنع ذكية

تصف الورقة أيضاً الآلة الفيزيائية (الشريحة) التي بُنيت لتشغيل هذا النظام:

  • عمال قابلون لإعادة التشكيل: عمال المصنع أذكياء. يمكنهم تغيير الأنماط. عندما يكون الكمبيوتر في مرحلة "القراءة" (الاستيعاب المسبـق)، يعملون بأرقام بسيطة وسريعة من فئة 8-بت. وعندما يكون في مرحلة "الكتابة" (فك التشفير)، ينتقلون إلى أرقام أكثر دقة من فئة 16-بت للحفاظ على الجودة العالية.
  • جامعات متخصصة: الخطوة الأخيرة من كتابة الكلمة تتضمن فقط جمع الأرقام معاً. يضيف EVA محطة "جمع" خاصة في نهاية الخط تكون سريعة جداً ولا تحتاج إلى أدوات رياضية معقدة، مما يحافظ على انسيابية الخط.

النتائج: السرعة والكفاءة

اختبرت الورقة EVA مقابل أفضل الأنظمة الموجودة حالياً (مثل FIGLUT وGPUs القياسية) باستخدام نماذج ذكاء اصطناعي شهيرة (مثل LLaMA).

  • السرعة: كان EVA أسرع بما يصل إلى 11 مرة في توليد النصوص من أفضل الأنظمة الحالية القائمة على البحث.
  • الطاقة: استخدم طاقة أقل بمقدار 7 مرات للقيام بنفس المهمة.
  • الجودة: رغم ضغط النموذج بشكل كبير (إلى دقة 2-بت، وهي تشبه ضغط صورة عالية الدقة إلى أيقونة صغيرة)، ظلت جودة النص ممتازة، مع عدم وجود أي فقدان تقريباً في الدقة.

الملخص

EVA يشبه إعادة تصميم مصنع بحيث بدلاً من وقوف العمال في طابور لالتقاط التعليمات واحداً تلو الآخر، يقومون بمعالجة التعليمات في مجموعة ضخمة ومنظمة حيث لكل منهم مساره الخاص. هذا يلغي الازدحامات المرورية، ويبقي جميع العمال مشغولين، ويجعل الذكاء الاصطناعي يكتب النصوص بسرعة وكفاءة أكبر بكثير.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →