← أحدث الأبحاث
💬 NLP

SPQ: An Ensemble Technique for Large Language Model Compression

تقدم هذه الورقة البحثية تقنية SPQ، وهي تقنية ضغط تجميعية تجمع بشكل تآزري بين تفكيك القيم المفردة (SVD)، والتقليم القائم على التنشيط، وتكميم ما بعد التدريب لتحقيق خفض كبير في الذاكرة وتحسين سرعة الاستدلال للنماذج اللغوية الكبيرة مثل LLaMA-2-7B مع الحفاظ على مستويات الارتياب ودقة المهام اللاحقة أو تعزيزها مقارنة بالنماذج المرجعية الحالية.

المؤلفون الأصليون: Jiamin Yao, Eren Gultepe

نُشر 2026-02-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiamin Yao, Eren Gultepe

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة وذكية للغاية (نموذج لغوي كبير أو LLM) يمكنها كتابة القصص، وحل المسائل الرياضية، والإجابة على الأسئلة. المشكلة هي أن هذه المكتبة ضخمة جدًا لدرجة أنها تشغل مستودعًا بأكمله، ويتطلب الأمر رافعة عملاقة لتحريك كتاب واحد فقط. أنت تريد تقليص حجم هذه المكتبة لتتسع في حقيبة ظهر ويمكن قراءتها بسرعة على كمبيوتر محمول عادي، ولكن دون أن تفقد القصص الذكية الموجودة بداخلها.

يقدم هذا البحث طريقة جديدة تسمى SPQ (SVD-Pruning-Quantization) للقيام بذلك بالضبط. فبدلاً من مجرد محاولة تقليص المكتبة بطريقة واحدة، يستخدم SPQ "هجوماً ثلاثي الأبعاد"، حيث يطبق استراتيجية تقليص مختلفة على أجزاء مختلفة من المكتبة حيث تعمل كل استراتيجية بشكل أفضل.

إليك كيف تعمل الأجزاء الثلاثة لـ SPQ، باستخدام تشبيهات بسيطة:

1. "مرشح التركيز" (SVD على طبقات الانتباه)

المشكلة: تحتوي المكتبة على قسم "انتباه" (Attention) ضخم. هذا هو القسم الذي ينظر فيه النموذج إلى الجملة ليعرف أي الكلمات مهمة لبعضها البعض. في نموذج ضخم، يكون هذا القسم مثل خزانة ملفات عملاقة وفوضوية تحتوي على آلاف الأدراج، والعديد منها فارغ أو يحتوي على ملفات مكررة.
حل SPQ: يستخدم SPQ تقنية تسمى SVD (تحليل القيم المفردة). فكر في هذا كأمين مكتبة فائق الذكاء ينظر إلى خزانة الملفات ويقول: "لسنا بحاجة إلى كل هذه الأدراج. يمكننا دمج محتويات 100 درج في 10 صناديق مدمجة فقط دون فقدان أي معلومات مهمة".

  • النتيجة: يحافظ على المعلومات الأكثر "حيوية" أو أهمية (التباين/variance) ويتخلص من الضجيج الزائد وغير الضروري. إنه يقلص قسم الانتباه بشكل كبير دون أن يجعل أمين المكتبة ينسى أي شيء مهم.

2. "تقليم الحديقة" (التقليم/Pruning على طبقات MLP)

المشكلة: تحتوي المكتبة أيضًا على قسم "استنتاج" (يُسمى طبقات MLP)، حيث يقوم النموذج بالعمليات الذهنية الشاقة. هذا القسم يشبه حديقة بها آلاف النباتات (النيورونات/العصبونات). بعض النباتات ضخمة ومزدهرة، لكن الكثير منها عبارة عن أعشاء ضارة صغيرة أو ضعيفة أو ميتة تأخذ مساحة ولكنها لا تقدم أي فائدة.
حل SPQ: يستخدم SPQ تقنية التقليم (Pruning). بدلاً من قص الحديقة بأكملها، فإنه ينظر إلى مقدار "ضوء الشمس" (التنشيط/activation) الذي يحصل عليه كل نبات. إذا كان النبات نادراً ما يُستخدم، يتم قصه تماماً.

  • النتيجة: يزيل الوزن الزائد. من خلال الاحتفاظ فقط بالنباتات التي تساهم فعلياً في جمال الحديقة، يصبح النموذج أصغر حجماً وأسرع بكثير، ومع ذلك تظل الحديقة تبدو وتفوح بنفس الرائحة.

3. "التحويل إلى نسخة جيب" (الكمية/Quantization)

المشكلة: حتى بعد دمج الأدراج وتقليم الأعشاض، لا تزال الكتب مكتوبة بحبر عالي الدقة ومطلي بماء الذهب (أرقام نقطة عائمة 32 بت). إنها دقيقة، لكنها تشغل مساحة كبيرة.
حل SPQ: يستخدم SPQ تقنية الكمية (Quantization). تخيل أخذ تلك الكتب الثقيلة المكتوبة بماء الذهب وإعادة طباعتها ككتب ورقية عادية خفيفة الوزن (أرقام صحيحة 8 بت).
النتيجة: ستفقد القليل من "لمعان الذهب"، ولكن بالنسبة لمعظم القصص، سيظل النص قابلاً للقراءة تماماً. هذه الخطوة وحدها تقلص حجم الكتب بنسبة 75% تقريباً.

لماذا نجمع بين الثلاثة؟ (سحر المجموعة)

إذا قمت بواحدة من هذه العمليات فقط، فستواجه المشاكل التالية:

  • إذا قمت فقط بـ التقليم (قص الأعشاض)، فقد تقطع بالخطأ زهرة نادرة كانت نائمة فقط، مما يجعل النموذج يصاب بالارتباك.
  • إذا قمت فقط بـ ضغط الملفات (SVD)، فقد تفقد الكثير من التفاصيل في الاستنتاج المعقد.
    وإذا قمت فقط بـ إعادة الطباعة ككتب ورقية (الكمية)، فستصبح الكتب صغيرة جداً لدرجة أن النص سيصبح ضبابياً وصعب القراءة.

SPQ هو الخدعة السحرية للقيام بالثلاثة معاً.
الأمر يشبه أخذ حقيبة سفر ثقيلة ومزدحمة:

  1. تقوم أولاً بإعادة ترتيب الملابس (SVD) لتناسبها بشكل أضيق.
  2. ثم ترمي الجوارب التي لا ترتديها أبداً (التقليم).
  3. ثم تلف كل شيء (الكمية) لتوفير المساحة.

النتيجة؟ الحقيبة الآن أصغر بنسبة 75%، ولكن لا يزال بإمكانك العثور على قميصك المفضل فوراً.

الفوز في العالم الحقيقي

اختبر البحث هذه الطريقة على نموذج مشهور يسمى LLaMA-2-7B.

  • قبل: كان وزنه حوالي 27 جيجابايت (كبير جداً لمعظم الهواتف أو أجهزة الكمبيوتر المحمولة الصغيرة).
  • بعد SPQ: أصبح وزنه 6.86 جيجابايت فقط.
  • السرعة: لا يكتفي بكونه يتسع في حقيبة ظهر فحسب؛ بل يعمل بسرعة أكبر بمقدار 1.9 مرة من طرق التقليص الشهيرة الأخرى (مثل GPTQ).

الخلاصة:
يثبت SPQ أنه ليس عليك الاختيار بين نموذج صغير ونموذج ذكي. من خلال كونك ذكياً في تحديد أين تطبق كل تقنية تقليص، يمكنك وضع عقل عملاق في حقيبة ظهر وجعله يعمل أسرع من أي وقت مضى. هذا يجعل الذكاء الاصطناعي القوي متاحاً للناس العاديين على أجهزة الكمبيوتر العادية، وليس فقط في مراكز البيانات الضخمة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →