Attention to Mamba: A Recipe for Cross-Architecture Distillation
تقترح هذه الورقة وصفة تقطير منهجية من مرحلتين تقوم أولاً بتحويل نموذج "ترانسفورمر" (Transformer) إلى نموذج انتباه خطي، ثم تنقل هذه المعرفة إلى بنية "مامبا" (Mamba)، مما ينجح في الحفاظ على أداء النموذج المعلم الأصلي دون الاعتماد على كتل هجينة تجمع بين الانتباه ونماذج الحالة الفراغية (Attention-SSM).