Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution
تكشف هذه الورقة أن نماذج خليط الخبراء (MoE) المدربة مسبقاً والموجودة حالياً تمتلك بطبيعتها تشتتاً كبيراً في تنشيط الخلايا داخل الخبير الواحد، وهو ما يمكن الاستفادة منه عبر تعديل مسار تنفيذ vLLM لتخطي حسابات الخلايا غير النشطة، مما يحقق تسريعاً يصل إلى 2.5 ضعف في تنفيذ طبقة MoE و1.2 ضعف في السرعة الإجمالية للنظام دون الحاجة إلى أي إعادة تدريب للنموذج أو تعديل للمعلمات.