AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization
تقدم الورقة البحثية AAAC، وهي طريقة كمية ما بعد التدريب خفيفة الوزن تحقق ضغطاً فائقاً لأوزان النماذج اللغوية الكبيرة (LLMs) بدقة 4 بت عبر استخدام كتب رموز تكيفية مدركة للتنشيط لتقليل خطأ إعادة البناء مع عبء تخزين مهمل ووقت كمي أسرع بكثير مقارنة بالأساليب القائمة على التدرج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مكتبة ضخمة من الكتب (نموذج لغوي كبير) وتريد حملها في جيبك. بما أن هذه الكتب ضخمة جدًا، فقد قررت تقليص حجمها لتناسب الجيب. تسمى هذه العملية الكمية (Quantization).
في الوقت الحالي، يقوم معظم الناس بتقليص هذه الكتب عبر إجبار كل كلمة على الانضواء تحت شبكة صلبة ومعدة مسبقًا من الفتحات بسعة 4 بت. تخيل الأمر كأنك تحاول وضع صخور غير منتظمة الشكل داخل صندوق من قطع "ليغو" المربعة المثالية؛ سيتعين عليك تقطيع الصخور أو ضغطها لتناسب الصندوق، مما يؤدي لفقدان بعض التفاصيل ويجعل القصة ضبابية بعض الشيء.
تحاول الطرق الموجودة إصلاح ذلك عن طريق تدوير الصخور أو زيادة مساحة الصندوق، لكنها لا تزال مضطرة لاستخدام نفس شبكة "الليغو" الصلبة.
يقترح نظام AAAC (أكواد التشفير التكيفية الواعية بالتنشيط) طريقة أذكى لتقليص حجم الكتب. وإليك كيف يعمل، باستخدام تشبيهات بسيطة:
1. المشكلة: الشبكة "الموحدة للجميع"
في عملية الكمية القياسية بسعة 4 بت، تُجبر كل مجموعة من الأرقام (الأوزان) على الالتزام بنفس المجموعة الثابتة من القيم (مثل قائمة طعام ثابتة تحتوي على 16 عنصرًا). إذا لم يتطابق الرقم تمامًا، يتم تقريبه إلى أقرب خيار متاح، مما يؤدي لفقدان الدقة.
2. حل AAAC: حقيبتان للأدوات مخصصتان
بدلاً من استخدام قائمة طعام واحدة ثابتة لكل طبقة، يقوم AAAC بإنشاء حقيبتين صغيرتين للأدوات المخصصة (تسمى أكواد التشفير - codebooks) لكل طبقة في النموذج.
- حجم ضئيل: هذه الحقائب صغيرة للغاية، حيث تبلغ مساحتها حوالي 64 بايت فقط لكل طبقة. وهذا يعادل تقريبًا حجم "إيموجي" واحد في رسالة نصية.
- مصنوعة خصيصًا: بدلاً من أن تكون ثابتة، يتم "تعلم" هذه الحقائب من عينة صغيرة من نشاط النموذج. فهي مصممة خصيصًا لتناسب أشكال الصخور (الأوزان) في تلك الطبقة المحددة.
3. كيف يختار: خدعة "بت الإشارة"
لكل مجموعة من الأرقام، يقرر AAAC أي من حقيبتي الأدوات المخصصتين هي الأنسب.
- القرار: يختار الحقيبة التي تقلل الخطأ إلى أدنى حد، مع التركيز بشكل خاص على الأرقام "المهمة" بناءً على كيفية "تفكير" النموذج حاليًا (التنشيطات).
- سحر التخزين: هذا هو الجزء الذكي. يقوم النموذج بالفعل بتخزين "بت الإشارة" (مؤشر الموجب أو السالب) لأرقام المقياس الخاصة به. ومع ذلك، نظرًا لأن أرقام المقياس هذه تكون دائمًا موجبة، فإن بت الإشارة هذا يكون عادةً فارغًا (مساحة ضائعة). يقوم AAAC بإخفاء اختيار حقيبة الأدوات (0 أو 1) داخل بت الإشارة غير المستخدم هذا.
- النتيجة: تحصل على ملاءمة مخصصة وأكثر ذكاءً دون أي تكلفة إضافية في مساحة التخزين.
4. السرعة والكفاءة: النهج "خفيف الوزن"
تتطلب العديد من الطرق الأخرى التي تحاول تحسين الدقة مجهودًا شاقًا:
- الطرق القائمة على التدرج (Gradient-based): تشبه محاولة حل لغز بينما تركض في ماراثون؛ فهي تحتاج لساعات من الوقت وكميات هائلة من ذاكرة الوصول العشوائي (RAM) لحساب الرياضيات المعقدة بشكل عكسي.
- AAAC: يشبه حل اللغز باستخدام طريقة استدلالية (heuristic) بسيطة وسريعة. فهو لا يحتاج للعمل بشكل عكسي أو استخدام ذاكرة ثقيلة. إنه يكتفي بالنظر إلى البيانات مرة واحدة، ويقوم بعملية "تجميع" (clustering) سريعة، ثم يختار أفضل حقائب الأدوات.
- الوقت: ينتهي العمل في غض- 3 إلى 30 دقيقة على بطاقة رسوميات واحدة، بينما قد تستغرق الطرق عالية الجودة الأخرى ساعات.
5. النتائج
اختبرت الورقة البحثية نظام AAAC مقابل العديد من الطرق الشائعة الأخرى (مثل AWQ و GPTQ و OmniQuant) عبر أحجام مختلفة من النماذج (من النماذج الصغيرة بسعة 1 مليار معلمة إلى النماذج الكبيرة بسعة 27 مليار معلمة).
- الدقة: أنتج AAAC باستمرار نتائج أكثر وضوحًا ودقة من الطرق "خفيفة الوزن" الأخرى.
- المنافسة: بل إنه طابق أو تفوق على الطرق "الثقيلة" التي تستغرق ساعات، لكنه فعل ذلك في دقائق معدودة.
- الدمج: عند دمجه مع طريقة أخرى تسمى AWQ، استعاد أكثر من 70% من الجودة المفقودة أثناء الضغط، مقتربًا جدًا من جودة النموذج الأصلي كامل الحجم.
ملخص
AAAC هو طريقة سريعة ولا تستهلك مساحة إضافية لتقليص أحجام نماذج الذكاء الاصطناعي. فبدلاً من إجبار البيانات على الانضواء تحت شبكة صلبة ومعدة مسبقًا، يقوم ببناء شبكتين مخصصتين وصغيرتين لكل طبقة، ويخفي اختيار الشبكة داخل بت من المساحة المهدرة. يحقق دقة عالية في دقائق، دون الحاجة إلى قوة الحوسبة الهائلة التي تتطلبها الطرق الأقدم والأكثر تعقيدًا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.