WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning
تقدم الورقة البحثية WIDE، وهو أول إطار عمل قابل للتفاضل من طرف إلى طرف يتيح تقليم العرض الديناميكي على مستوى الرمز (token-level) للنماذج اللغوية الكبيرة عبر السماح بالاختيار الدقيق لرؤوس الانتباه وقنوات الشبكات العصبية المغذية (FFN)، مقترناً بتصميم مشترك متخصص للنواة (kernel co-design) لتحقيق تسريع كبير في الاستنتاج من طرف إلى طرف مع الحفاظ على دقة عالية.