← أحدث الأبحاث
🤖 machine learning

QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling

يقدم QAM-W طريقة تكميم كتاب رموز ثنائي الأبعاد مشترك لأوزان النماذج اللغوية الكبيرة تستخدم دوران هادامارد والتحجيم الواعي للتنشيط للحفاظ على هياكل الإحداثيات الزوجية، محققاً تقاربًا مع مستويات إرباك (perplexity) تنسيق BF16 عند حوالي 5.5 بت لكل وزن، مع التفوق على الترميز القطبي ومضاهاة جودة SmoothQuant بعدد أقل بكثير من بتات الأوزان.

المؤلفون الأصليون: Preetam Sharma, Kacper Dobek

نُشر 2026-05-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Preetam Sharma, Kacper Dobek

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة من الكتب (نموذج لغوي كبير، أو LLM) وهي ذكية للغاية ولكنها تشغل مساحة هائلة. ولجعل من السهل حملها، تريد تقليص حجم هذه الكتب. تسمى هذه العملية "التكميم" (Quantization).

معظم الطرق الحالية لتقليص هذه الكتب تشبه أخذ قاموس واستبدال كل كلمة فيه برمز رقمي قصير، كلمة تلو الأخرى. إنها طريقة بسيطة، لكنها تتجاهل حقيقة أن الكلمات غالباً ما تأتي في أزواج أو مجموعات تربطها علاقة محددة ببعضها البعض. إذا تعاملت معها كأفراد منعزلين، فستفقد بعضاً من تفاصيل القصة ودقتها.

تقدم هذه الورقة البحثية طريقة جديدة تسمى QAM-W (تعديل سعة التربيع للموازين). فكر في الأمر كطريقة أكثر ذكاءً وكفاءة لتعبئة تلك الكتب.

إليك كيف تعمل، باستخدام تشبيهات بسيطة:

1. المشكلة: "الراقص المنفرد" مقابل "الثنائي"

تخيل أن الأوزان (weights) في نموذج الذكاء الاصطناعي هي راقصون.

  • الطريقة القديمة (التكميم القياسي - Scalar Quantization): الطريقة القديمة تعامل كل راقص كما لو كان يؤدي رقصة منفردة. فهي تنظر إلى كل راقص بشكل فردي وتقول: "أنت '3'، أنت '7'". إنها تتجاهل حقيقة أن اثنين من الراقصين قد يكونان ممسكين بأيدي بعضهما أو يتحركان في تناغم.
  • رؤية QAM-W: أدرك المؤلفون أنه ضمن صف من البيانات، هؤلاء "الراقصون" هم في الواقع يرقصون في ثنائيات. إنهم مترابطون. وبدلاً من ترميزهم كفردين منفصلين، يعاملهم QAM-W كـ ثنائي.

2. الحل: "الدوران السحري" و"الاقتران"

يستخدم QAM-W عملية من ثلاث خطوات لتقليص النموذج دون فقدان القصة:

  • الخطوة أ: الدوران السحري (دوران هادامارد - Hadamard Rotation):
    تخيل الراقصين وهم يقفون في غرفة مزدحمة وفوضوية. يقوم QAM-W بتطبيق "دوران سحري" (دوران رياضي) يعيد ترتيبهم. فجأة، الراقصون الذين كانوا يتحركون بشكل عشوائي أصبحوا الآن مقترنين ببعضهم البعض بشكل مثالي، ويتحركون في نمط دائري سلس. هذا يجعل وصفهم رياضياً أسهل بكثير.

  • الخطوة ب: "كتاب الرموز" للثنائي (The "Duet" Codebook):
    بدلاً من إعطاء كل راقص رقماً منفصلاً، ينظر QAM-W إلى الزوج كنقطة واحدة على الخريطة. إنه يستخدم "خريطة" جاهزة (كتاب رموز) تم تدريبها على كيفية سلوك هذه الأزواج عادةً. الأمر يشبه امتلاك مكتبة من حركات الرقص القياسية للثنائيات. بدلاً من وصف خطوتين منفصلتين، تقول فقط: "لقد قاما بحركة 'الفالس رقم 42'". هذا يلتقط العلاقة بين الرقمين، مما يوفر المساحة.

  • الخطوة ج: "مقبض التحكم في الصوت" (التحجيم المدرك للتنشيط - Activation-Aware Scaling):
    أحياناً تكون بعض أجزاء النموذج صاخبة جداً (نشطة للغاية) وأجزاء أخرى هادئة. إذا قللت حجم الأجزاء الصاخبة أكثر من اللازم، فستتشوه الموسيقى. يستمع QAM-W إلى "مستوى الصوت" لكل قناة قبل التقليص. إنه يخفض مستوى صوت القنوات الصاخبة قليلاً لتناسب المساحة الصغيرة بشكل أفضل، مما يضمن عدم سحق المعلومات الأكثر أهمية.

3. النتائج: حجم أصغر، نفس الجودة

اختبرت الورقة هذه الطة الجديدة على خمسة نماذج مختلفة للذكاء الاصطناائي (تتراوح من الصغيرة إلى المتوسطة والكبيرة).

  • "النقطة المثالية": عند مستوى ضغط معين (حوالي 5.5 بت لكل وزن)، حقق QAM-W نتائج مطابقة تقرياً للنموذج الأصلي غير المضغوط.
  • المقارنة: احتاجت طريقة منافسة شهيرة تسمى SmoothQuant إلى استخدام حوالي 8.1 بت للحصول على نفس الجودة. حقق QAM-W نفس النتيجة باستخدام 32% أقل من البتات.
    • تشبيه: الأمر يشبه حزم حقيبة سفر. تحتاج SmoothQuant إلى حقيبة كبيرة لتتسع لملابسك بشكل مرتب. أما QAM-W فيقوم بطي الملابس بكفاءة عالية بحيث يمكنك وضع نفس الكمية في حقيبة أصغر بكثير.

4. ما لا تفعله (الحدود)

الورقة محددة جداً فيما لا تدعي القيام به:

  • ليست الأصغر: إذا حاولت تقليص النموذج أكثر (حتى يصل إلى 4 بت)، فإن طريقة أخرى تسمى QTIP تؤدي بشكل أفضل. QAM-W هو البطل في نطاق "المتوسط-الصغير" (5-6 بت)، وليس في النطاق "الصغير جداً".
  • التخزين مقابل السرعة: تقيس الورقة مقدار المساحة التي يشغلها النموذج على القرص الصلب أو في الذاكرة. هي لا تدعي بعد أنها تجعل النموذج يعمل بسرعة أكبر على شريحة الكمبيوتر، لأن البرمجيات اللازمة لاستخدام هذه الأرقام المضغوطة في الوقت الفعلي لا تزال قيد البناء.

ملخص

QAM-W هو "تقنية حزم" جديدة لنماذج الذكاء الاصطناعي. من خلال إدراك أن البيانات تأتي في أزواج، وتدويرها إلى شكل أفضل، والتكيف مع مستوى الصوت، يمكنه تقليص نماذج الذكاء الاصطناعي بنحو الثلث دون جعلها أقل ذكاءً. إنها أداة متخصصة تعمل بشكل أفضل في نطاق حجم معين، وتوفر توفيراً كبيراً في مساحة التخزين مقارنة بالطرق الحالية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →