Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection
تقترح هذه الورقة البحثية "انتباه التوكن المتناثر" (Token Sparse Attention)، وهو آلية ديناميكية وعكوسة لتناثر مستوى التوكن تعمل على ضغط وفك ضغط أزواج المفتاح والقيمة (key-value pairs) أثناء عملية الانتباه لتحقيق تسريع كبير في الاستنتاج لنماذج اللغات الكبيرة ذات السياق الطويل مع حد أدنى من التدهور في الدقة.