Pruning and Distilling Mixture-of-Experts into Dense Language Models
تقدم هذه الورقة إطار عمل مبتكر يحول نماذج "خليط الخبراء" (MoE) المدربة إلى بنيات كثيفة قياسية من خلال تقييم واختيار وتجميع الخبراء متبوعاً بعملية تقطير المعرفة، مما يثبت أن هذا النهج يتفوق بشكل كبير على عمليات التقليم التقليدية من النموذج الكثيف إلى النموذج الكثيف في الدقة وكفاءة التدريب.