The Entropic Bound for Transformers: Why Static Rank Fails and Attention-Native Rank Recovers
تثبت هذه الورقة أنه بينما تفشل قيود الرتبة الثابتة في استيعاب السعة الجوهرية لنماذج المحولات (Transformers) بسبب طبيعة الانتباه المشروطة بالمدخلات، فإن الرتبة الجوهرية الأصلية للانتباه القائمة على نواة الاستعلام-المفتاح (query-key kernel) تنجح في استعادة مبادئ الحد الإنتروبي للقصور، والقابلية للتحقيق، واستعادة التدرج لآليات انتباه الخطية و"softmax" على حد سواء.