Pruning and Distilling Mixture-of-Experts into Dense Language Models
تقدم هذه الورقة إطار عمل مبتكر يحول نماذج "خليط الخبراء" (MoE) المدربة إلى بنيات كثيفة قياسية من خلال تقييم واختيار وتجميع الخبراء متبوعاً بعملية تقطير المعرفة، مما يثبت أن هذا النهج يتفوق بشكل كبير على عمليات التقليم التقليدية من النموذج الكثيف إلى النموذج الكثيف في الدقة وكفاءة التدريب.
المؤلفون الأصليون: Junhyuck Kim, Jihun Yun, Haechan Kim, Gyeongman Kim, Joonghyun Bae, Jaewoong Cho
المؤلفون الأصليون: Junhyuck Kim, Jihun Yun, Haechan Kim, Gyeongman Kim, Joonghyun Bae, Jaewoong Cho
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: تقليم وتكثيف نماذج خليط الخبراء (MoE) إلى نماذج لغوية كثيفة
بيان المشكلة
أصبحت بنيات "خليط الخبراء" (Mixture-of-Experts - MoE) هي النموذج السائد لنماذج اللغات الكبيرة (LLMs) الرائدة، وذلك لقدرتها على توسيع إجمالي عدد المعلمات مع الحفاظ على كفاءة التدريب والخدمة. ومع ذلك، لا يزال هناك قصور جوهري: على الرغم من تفعيل جزء ضئيل فقط من المعلمات لكل رمز (token)، إلا أن نماذج MoE تتطلب تحميل جميع معلمات الخبراء في الذاكرة. هذا البصمة الذاكرية تجعلها غير مناسبة لسيناريوهات النشر ذات الذاكرة المحدودة، مثل الاستدلال على الأجهزة أو الخدمة عبر وحدة معالجة رسومية واحدة (Single-GPU).
تتضمن الحلول الحالية إصدار نماذج كثيفة صغيرة منفصلة يتم تدريبها من الصفر أو عبر التقليم المتتالي لنماذج كثيفة كبيرة تعمل كمعلم (Teacher). هذه الأساليب مكلفة حوسبيًا وتفشل في الاستف والاستفادة من القدرات الغنية الموجودة بالفعل في نموذج MoE المدرب. كما أن طرق ضغط MoE الحالية (مثل MC-SMoE وHC-SMoE) تقلل عدد الخبراء ولكنها تحتفظ ببنية MoE المتفرقة (Sparse)، مما يحافظ على عدم كفاءة الذاكرة. وهناك نقص في الأطر المنهجية لتحويل نموذج MoE مدرب إلى بنية كثيفة (Dense) قياسية بالكامل.
المنهجية
يقدم المؤلفون أول إطار عمل منهجي لتحويل نموذج لغوي من نوع MoE مدرب إلى بنية كثيفة بالكامل من خلال مسار يتكون من ثلاث مراحل: تسجيل وتقييم الخبراء، التجميع والدمج، وتكثيف المعرفة (Knowledge Distillation).
1. تقييم واختيار الخبراء
يتضمن جوهر الطريقة تقييم جميع الخبراء E في طبقة ما لاختيار مجموعة فرعية بحجم K (حيث K≥k، و k هو عدد الخبراء النشطين لكل رمز). تقيم الورقة سبع طرق للتقييم:
- القائمة على التكرار (Frequency-based): تكرار الاختيار (SF)، احتمالية ما قبل الاختيار (PP)، واحتمالية ما بعد الاختيار (PS). هذه الطرق تفضل الخبراء العامين.
- الاحتمال الشرطي (Conditional Probability - CP): يركز على ثقة التوجيه (Routing Confidence)، ويفضل المتخصصين.
- الاحتمال الشرطي الموزون بالتنشيط (Activation-weighted CP - ACP): يجمع بين ثقة التوجيه ومقدار المخرجات.
- الاختيار الأمثل من نوع D (D-Optimal Selection - DO): معيار مبتكر يعمل على تعظيم الأهمية والتباين المتبادل (Mutual Diversity) بشكل مشترك. يقوم باختيار مجموعة فرعية S لتعظيم المحدد اللوغاريتمي لمصفوفة جرام (Gram matrix) الموزونة بالأهمية:
S∗=arg∣S∣=Kmaxlogdet(KS+λregI)
حيث Kij=IiIj⋅Et[⟨fi(t),fj(t)⟩]. ويتم حل هذه المسألة بطريقة جشعة (Greedy). يقترح المؤلفون طريقة DO-ACP (الاختيار الأمثل D بناءً على درجات ACP) كاستراتيجية مثلى.
2. التجميع والدمج
يتم تعيين الخبراء المختارين إلى k من المجموعات.
- التقليم الصرف (Pure Pruning) حيث K=k: تحتوي كل مجموعة على خبير واحد فقط؛ ولا يحدث أي متوسط للأوزان.
- الدمج (Merging) حيث K>k: يتم دمج الخبراء في مجموعة ما عبر متوسط أوزان معلماتهم الموزونة بالدرجات.
يتم دمج الـ k من المجموعات الناتجة في شبكة تغذية أمامية (FFN) كثيفة واحدة ببعد وسيط ddense=k×dexpert. يتم تغيير مقاييس مصفوفات الإسقاط السفلي (Down-projection matrices) بعوامل αg (موحدة أو متناسبة) لتقريب متوسط سلوك التوجيه الأصلي لـ MoE.
3. تكثيف المعرفة (Knowledge Distillation)
يتم تحسين النموذج الكثيف المبدئي عبر عملية تكثيف المعرفة من نموذج MoE المعلم. تهدف العملية إلى تقليل تباعد KL الأمامي (Forward KL divergence) بين توزيعات مخرجات المعلم والطالب. كما يستكشف المؤلفون توسيع توجيه المعلم أثناء التكثيف (تفعيل k′>k من الخبراء) لتعريض الطالب للمعرفة من الخبراء غير المختارين.
المساهمات الرئيسية
- أول إطار عمل لتحويل MoE إلى نموذج كثيف: تقدم الورقة أول نظام متكامل لتحويل نموذج MoE مدرب إلى بنية كثيفة بالكامل، متجاوزةً حدود إنتاج نماذج MoE أصغر ومتفرقة.
- اختيار الخبراء المراعي للتباين: يقدم المؤلفون معيار اختيار أمثل من نوع D (DO-ACP) يعظم المحدد اللوغاريتمي لمصفوفة جرام الموزونة بالأهمية. تمنع هذه الطريقة التكرار صراحةً، حيث تختار خبراء يتميزون بالأهمية والتباين في آن واحد.
- تقييم شامل: تدرس الورقة 350 تكويناً (7 طرق تقييم × 5 استراتيجيات تجميع × 2 تغيير مقياس × 5 قيم لـ K) على نموذج Qwen3-30B-A3B، وتتحقق من النتائج على DeepSeek-V2-Lite و GPT-OSS-20B.
النتائج
الأداء على Qwen3-30B-A3B
- هيمنة طريقة التقييم: اختيار طريقة التقييم هو العامل الأكثر تأثيراً، حيث يوجد فجوة قدرها 5.7 نقطة مئوية (pp) في متوسط الدقة في المهام النهائية بين أفضل وأسوأ الطرق. بينما تساهم استراتيجيات التجميع بنحو 1 نقطة مئوية فقط.
- تفوق DO-ACP: تتفوق طريقة DO-ACP باستمرار على جميع التكوينات الأخرى. عند K=8 (التقليم الصرف)، تحقق دقة متوسطة تبلغ 43.41% في الاختبارات النهائية (Winogrande, HellaSwag, ARC-E/C, MMLU).
- التقليم الصرف مقابل الدمج: بالنسبة للتقييم المراعي للتباين (DO-ACP, ACP)، يتفوق التقليم الصرف (K=k) على الدمج (K>k). أما الطرق القائمة على التكرار (SF) فتستفيد من الدمج، لكن خبراء DO-ACP أقوياء بما يكفي للوقوف بمفردهم.
- المقارنة مع النماذج المرجعية:
- مقابل ضغط MoE: تتفوق على مقاييس ضغط MoE المعاد توظيفها (مثل MC-SMoE و HC-SMoE) بمقدار 5.9 إلى 7.1 نقطة مئوية.
- مقابل التقليم من كثيف إلى كثيف (D2D): في مقارنة مضبوطة مع معلم كثيف مطابق في عدد المعلمات (Qwen3-32B → 3.4B student)، يتفوق تحويل MoE إلى كثيف (DO-ACP) على تقليم D2D بمقدار +6.3 نقطة مئوية (58.10% مقابل 51.84%) بعد حوالي 4 مليارات رمز من التكثيف.
- مقابل التهيئة العشوائية: تتفوق على التهيئة العشوائية لـ FFN بمقدار +12.7 نقطة مئوية، مما يثبت أن بنية الخبراء توفر تهيئة قوية.
التدريب الممتد والتحقق عبر النماذج
- التوسع (Scaling): تستمر ميزة الأداء لـ DO-ACP وتتسع مع التدريب الممتد (∼4 مليارات رمز).
- التعميم: تعمم النتائج على DeepSeek-V2-Lite (64 خبيراً) و GPT-OSS-20B (32 خبيراً). وبينما تتقلص الفجوة المطلقة بين طرق التقييم مع تناقص حجم مجموعة الخبراء، تظل DO-ACP هي الأفضل أداءً.
- الكفاءة: عملية تكثيف MoE إلى نموذج كثيف أسرع بـ 1.6 مرة في وقت التنفيذ الفعلي من تقليم D2D لأن معلم MoE يفعل معلمات أقل لكل رمز خلال مرحلة التكثيف.
التحليل النوعي
يكشف تحليل الخطأ في مهام سلسلة الأفكب (Chain-of-thought) لـ MMLU أن نماذج DO-ACP تسجل أدنى معدلات للفشل الكارثي (عدم الترابط، الحلقات المتكررة) وأخطاء المعرفة مقارنة بـ D2D والطرق القائمة على التكرار. يبدو أن الاختيار المراعي للتباين يحافظ على المعرفة الواقعية والثقافية بشكل أكثر فعالية، لا سيالما في العلوم الإنسانية والاجتماعية.
الأهمية والادعاءات
تدعي الورقة تقديم وصفة بسيطة وفعالة لنشر قدرات MoE في البيئات ذات الذاكرة المحدودة: التقييم باستخدام DO-ACP، الاحتفاظ بالضبط بأعلى k من الخبراء لكل طبقة (التقليم الصرف)، والتكثيف باستخدام KL الأمامي.
يؤكد المؤلفون أن هذا النهج يحول "عدم كفاءة الذاكرة" في MoE إلى "كفاءة كثيفة" دون التضحية بمكاسب الأداء المستمدة من بنية الخبراء المتخصصة في MoE. ويذهبون إلى أن نماذج MoE توفر نقطة انطلاق أقوى لعملية التكثيف من المعلمين الكثيفين ذوي عدد المعلمات المماثل، مما يتحدى ضرورة تدريب النماذج الكثيفة من الصفر أو تقليم المعلمين الكثيفين. وتخلص الدراسة إلى أن تنوع الخبراء، وليس مجرد التكرار أو المقدار، هو العامل الحاسم في ضغط نماذج MoE إلى بنيات كثيفة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.
تصلك أفضل أبحاث NLP كل أسبوع.
يحظى بثقة باحثين في ستانفورد وكامبريدج والأكاديمية الفرنسية للعلوم.
تفقّد بريدك لتأكيد الاشتراك.
حدث خطأ ما. تعيد المحاولة؟
لا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.