MiTA Attention: Efficient Fast-Weight Scaling via a Mixture of Top-k Activations
تقترح هذه الورقة بحث "MiTA attention"، وهو إطار عمل موحد يعمل على توسيع الأوزان السريعة في نماذج "Transformers" بكفاءة من خلال ضغط طبقة "MLP" ذات العرض "N" إلى طبقة أضيق، وبناء خبراء قابلين للتشكل عبر استراتيجية "خليط من أعلى k من التنشيطات" (Mixture of Top-k Activations)، مما يتيح التعامل الفعال مع التسلسلات الطويلة للغاية.