Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus
تقدم هذه الورقة أول دراسة منهجية للتنشيطات الضخمة في نماذج اللغات الكبيرة ذات الانتباه الخطي الهجين، كاشفةً عن مورفولوجيتين متمايزتين متواقيتين مع البنية —القمم ما قبل الانتباه والهضاب بين القمم— تظهران في وقت مبكر من التدريب، وتستمر عبر مختلف المقاييس والمجالات، ويُفسَّران آلياً من خلال دورة حياة مشتركة من إلغاء التنشيط.