Multi-Head Attention Residuals
تقدم هذه الورقة البحثية "بقايا الانتباه متعدد الرؤوس" (MHAR)، وهي تعديل هيكلي خالٍ من المعلمات يُمكّن الفضاءات الفرعية للميزات المختلفة من الانتباه بشكل مستقل إلى تاريخ العمق عبر رؤوس توجيه متعددة، مما يؤدي إلى حل عدم الاتفاق بين الفضاءات الفرعية وتحسين خسارة التحقق وأداء المهام اللاحقة بشكل كبير عبر مختلف أحجام النماذج مقارنة بنماذج المحولات (Transformers) القياسية.