SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning
تقترح الورقة البحثية SpargeAttention2، وهي طريقة انتباه متناثرة قابلة للتدريب لنماذج الانتشار تجمع بين قاعدة قناع هجينة (Top-k+Top-p) وهدف ضبط دقيق مستوحى من التقطير لتحقيق تشتت بنسبة 95% وتسريع بمقدار 16.2 ضعفًا مع الحفاظ على جودة التوليد.