Long Context Pre-Training with Lighthouse Attention
تقدم هذه الورقة "Lighthouse Attention"، وهي خوارزمية اختيار هرمي تعتمد على التدريب فقط وخالية من التدرج، تغلف آلية الانتباه القياسية بنظام الضرب النقطي المقيّس لتمكين التدريب المسبق عالي الكفاءة وغير التربيعي لنماذج المحولات السببية عند أطوال تسلسل قصوى، والتي يمكن إزالتها بسلاسة عبر مرحلة استرداد قصيرة لإنتاج نموذج انتباه كامل يتميز بتدريب أسرع وفقدان نهائي أقل.