Attention to Mamba: A Recipe for Cross-Architecture Distillation
تقترح هذه الورقة وصفة تقطير منهجية من مرحلتين تقوم أولاً بتحويل نموذج "ترانسفورمر" (Transformer) إلى نموذج انتباه خطي، ثم تنقل هذه المعرفة إلى بنية "مامبا" (Mamba)، مما ينجح في الحفاظ على أداء النموذج المعلم الأصلي دون الاعتماد على كتل هجينة تجمع بين الانتباه ونماذج الحالة الفراغية (Attention-SSM).
تخيل أن لديك نوعين مختلفين تماماً من الطهاة يحاولان طهي نفس الوجبة اللذيذة (نموذج لغوي يفهم النص البشري).
الشيف ترانسفورمر (المعلم): هذا الشيف خبير. لقد طبخ لسنوات، وحفظ الملايين من الوصفات، وطعامه مذهل. ومع ذلك، فهو يعمل بطريقة محددة جداً: لكي يطبخ طبقاً لـ 100 شخص، يتعين عليه النظر في طلب كل شخص على حدة، ومقارنته بطلب كل شخص آخر، ثم يقرر ماذا يطبخ. إنه دقيق للغاية، لكن عمله يصبح أبطأ بشكل أسّي كلما كبر الحشد. إذا كان لديك 1,000 شخص، فإن حجم العمل ينفجر.
الشيف مامبا (التلميذ): هذا شيف مبتدئ جديد وسريع جداً. يستخدم تقنية مختلفة حيث لا يحتاج إلى مقارنة الجميع ببعضهم البعض. هو فقط ينظر إلى الطلب الحالي وذاكرة الطلبات القليلة الماضية. هذا يجعله سريعاً للغاية ويستهلك طاقة قليلة جداً (ذاكرة)، حتى مع الحشود الضخمة. ولكن، ولأنه لا يزال جديداً، فإن طعامه ليس لذيذاً تماماً مثل طعام الشيف المعلم بعد.
المشكلة: أنت تريد سرعة التلميذ الجديد (مامبا) ولكن طعم المعلم (ترانسفورمر). عادةً، إذا حاولت تعليم التلميذ عبر مجرد قول: "قلد ما يفعله المعلم"، فإن الأمر يفشل. الأمر يشبه محاولة تعليم سباح كيف يركض؛ فعضلاته ودماغه يعملان بطرق مختلفة. سيصاب التلميذ بالارتباك وينتهي به الأمر بطبخ طعام سيء للغاية.
الحل: "وصفة الخطوتين" يقترح هذا البحث طريقة "ترجمة" ذكية لتعليم التلميذ السريع كيف يطبخ مثل المعلم، دون فقدان ميزة السرعة.
الخطوة 1: "المترجم" (الانتباه الخطي - Linear Attention)
أولاً، نحن لا نقفز مباشرة من المعلم إلى التلميذ. بل نقدم وسيطاً يسمى هيدجوغ (Hedgehog).
فكر في طريقة الشيف المعلم (Software Attention) كلغة سحرية معقدة. التلميذ يتحدث لغة خطية بسيطة.
الخدعة: نستخدم "مترجماً" رياضياً (يعتمد على شيء يسمى Kernel Trick) لإعادة كتابة تعليمات المعلم المعقدة إلى نسخة خطية أبسط يمكن للتلميذ فهمها تقريباً.
التشبيه: تخيل أن المعلم كتب قصيدة. يقوم المترجم بإعادة كتابة تلك القصيدة إلى قصيدة "هايكو" بسيطة. إنها ليست نفس القصيدة تماماً، لكنها تلتقط الجوهر والشعور بشكل مثالي. يتعلم التلميذ نسخة "الهايكو" هذه أولاً.
الخطوة 2: "الترقية" (HedgeMamba)
الآن بعد أن فهم التلميذ نسخة "الهايكو"، نعطيه مجموعة أدوات خاصة لجعلها أفضل.
نأخذ تعليمات "الهايكو" ونغذي بها عقل التلميذ (بنية Mamba).
نضيف بعض "التروس" و"الروافع" الإضافية (مثل بوابة وتلافيف ذاكرة قصيرة) التي لم تكن لدى المعلم، ولكنها تساعد التلميذ على معالجة المعلومات بشكل أسرع حتى.
النتيجة: يطبخ التلميذ الآن وجبة تشبه طعام المعلم بنسبة 98%، لكنه يفعل ذلك في جزء ضئيل من الوقت وبجزء ضئيل من الطاقة.
لماذا هذا مهم (ما الفائدة؟)
السرعة والكفاءة: نموذج "HedgeMamba" الجديد يمكنه قراءة كتاب كامل في لحظات، بينما قد يستغرق نموذج المعلم القديم ساعات لنفس المهمة.
عدم الحاجة للبدء من الصفر: عادةً، للحصول على نموذج سريع، عليك تدريبه من الصفر، وهو أمر يكلف ملايين الدولارات ويستغرق سنوات. تسمح لنا هذه الطريقة بـ "تقطير" (ضغط) معرفة نموذج موجود ومكلف في نموذج سريع بتكلفة ضئيلة جداً.
الإثبات: اختبر المؤلفون هذا باستخدام نموذج بمليار معلمة (parameter).
المعلم: سجل درجة "الارتباك" (Perplexity - مقياس لمدى ارتباك النموذج) بلغت 13.86.
التلميذ (باستخدام هذه الوصفة الجديدة): سجل 14.11.
الطريقة القديمة (التقطير الساذج): سجلت +100 (كارثة).
السر الخفي
الرؤية الجوهرية لهذا البحث هي المحاذاة (Alignment). لا يمكنك مجرد إجبار التلميذ على تقليد حركات المعلم مباشرة. يجب عليك أولاً ترجمة حركات المعلم إلى لغة يفهمها التلميذ (Linear Attention)، ثم ترك التلميذ يصقل تلك الحركات بنقاط قوته الفريدة.
باختصار: عرف هذا البحث كيف يعلم سائق سيارة سباق (Mamba) كيف يقود مثل بطل فورمولا 1 (Transformer) عن طريق تعليمه أولاً قيادة سيارة "جو كارت" تحاكي مسارات البطل، ثم ترقية سيارة "الجو كارت" لتصبح سيارة سباق. النتيجة؟ سيارة سريعة تقود مثل الأبطال.
إليك ملخص تقني مفصل لورقة البحث بعنوان: "Attention to Mamba: A Recipe for Cross-Architecture Distillation" (الانتباه إلى مامبا: وصفة للتقطير عبر البنى الهيكلية).
1. بيان المشكلة
تعالج الورقة التحدي المتمثل في سد الفجوة في الأداء بين نماذج Transformer (التي تعتمد على آلية "Softmax Attention" ذات التعقيد التربيعي) ونماذج نماذج فضاء الحالة (SSMs) مثل Mamba (التي توفر استنتاجاً ذا تعقيد خطي واستهلاكاً أقل للذاكرة).
المعضلة: بينما يوفر Mamba كفاءة فائقة، إلا أنه غالباً ما يقل أداءه مقارنة بنماذج Transformer المدربة مسبقاً في المهام اللاحقة. وعلى العكس من ذلك، فإن تدريب نماذج SSM من الصفر مكلف حاسوبياً ويتطلب مجموعات بيانات ضخمة.
فجوة التقطير: فشلت المحاولات المباشرة لتقطير المعرفة من معلم (Teacher) من نوع Transformer إلى طالب (Student) من نوع Mamba تاريخياً. فالمحاولات الساذجة تؤدي إلى تدهور كبير في الأداء (على سبيل المثال، perplexity > 100) لأن هذين الهيكلين يعملان وفق نماذج حسابية مختلفة جذرياً (الاهتمام التربيعي مقابل التكرار الخطي). وغالباً ما تعتمد الحلول الهجينة السابقة على مسارات معقدة متعددة المراحل أو الاحتفاظ ببعض كتل "الاهتمام" (Attention)، مما يبطل الغرض من الكفاءة الصرفة.
2. المنهجية: وصفة التقطير ذات المرحلتين
يقترح المؤلفون نهج تقطير منضبطاً يتكون من مرحلتين، يستفيد من الروابط الرياضية بين "الاهتمام" (Attention) و"نماذج فضاء الحالة" (SSMs) لتسهيل نقل المعرفة دون الحاجة للتدريب من الصفر.
المرحلة الأولى: Softmax Attention → Linear Attention (جسر "Hedgehog")
الهدف: تقريب آلية Softmax Attention غير الخطية باستخدام نسخة "الاهتمام الخطي" (Linear Attention) قابلة للتعلم.
الآلية: تستخدم الورقة نهج Hedgehog (Zhang et al., 2024). فبدلاً من التخلص من الـ Softmax (الذي يفقد ميزات حاسمة مثل "الحدة" أو "Spikiness")، يتم تعلم خريطة ميزة ϕ(x) عبر طبقة MLP واحدة لتقريب النواة الأسية باستخدام نظرية ميرسر (Mercer's theorem): exp(xTx′)≈ϕ(x)Tϕ(x′)
العملية: يتم استبدال Softmax Attention الخاص بـ Transformer بهذا النوع من "الاهتمام الخطي"، ويتم تقطير النموذج من معلم الـ Transformer باستخدام خسارة مطابقة تضمين جيب التمام (cosine embedding matching loss) على مخرجات كل طبقة.
النتيجة: نموذج "Transformer خطي" يحتفظ بأداء المعلم ولكنه يعمل بتعقيد خطي.
المرحلة الثانية: Linear Attention → Mamba (تهيئة "HedgeMamba")
الهدف: ترجمة أوزان "الاهتمام الخطي" إلى تهيئة لهيكل Mamba والضبط الدقيق لزيادة القدرة التعبيرية.
الارتباط النظري: يقوم المؤلفون بربط بارامترات "الاهتمام الخطي" (Q^,K^,V^) ببارامترات الـ SSM (C,B,X). وتحديداً:
B(X)←ϕMLP(K(X))
C(X)←ϕMLP(Q(X))
X←V(X)
يتم تهيئة مصفوفة اضمحلال الحالة Λ لتكون مصفوفة الوحدة (Identity matrix).
تكييف البنية (HedgeMamba):
يتم تعديل كتلة Mamba لتشمل إسقاط القيمة (Value projection - V) قبل خلاط الـ SSM (وهو ما يفتقر إليه Mamba القياسي).
التطبيع (Normalization): يتم حل مشكلة درجة الاهتمام غير المعيرة عن طريق توسيع حالة الـ SSM لحساب حد التطبيع (بشكل مشابه للمقام في Softmax) في تمريرة واحدة.
الضبط الدقيق (Fine-tuning): يتم ضبط النموذج بالكامل (باستثناء التضمينات/Embeddings) باستخدام خسارة الإنتروبيا المتقاطعة (Cross-Entropy loss) على البيانات الحقيقية. ومن الأهمية بمكان أن يتم "فتح" فرع البوابة (Gate branch) وطبقات الالتفاف (Convolution) في Mamba لتعزيز القدرة التعبيرية.
3. المساهمات الرئيسية
التهيئة المبدئية المنضبطة: إثبات أن تزويد Mamba بتهيئة "Hedgehog" (المشتقة من الاهتمام الخطي) يحل مشكلة محاذاة الهياكل المختلفة، متجنباً فشل التقطير الساذج.
وصفة المرحلتين: اقتراح مسار قائم على أسس نظرية:
المرحلة 1: محاذاة أوزان الاهتمام عبر الاهتمام الخطي (Hedgehog).
المرحلة 2: الانتقال إلى Mamba والضبط الدقيق باستخدام مكونات Mamba الخاصة (البوابات، الالتفافات).
بنية HedgeMamba: تقديم طبقة هجينة تجمع بين خريطة ميزة Hedgehog و"المسح الانتقائي" (selective scan) الخاص بـ Mamba، بما في ذلك التعديلات اللازمة (إسقاط القيمة، التطبيع) لضمان التكافؤ الوظيفي عند التهيئة.
التقييم الشامل: تقديم دراسات استئصال (Ablation studies) واسعة، وتحليلات القياس (Scaling analyses)، واختبارات الحساسية لتخصيص ميزانية الرموز (Token budget).
4. النتائج
أُجريت التجارب باستخدام Pythia-1B كمعلم و OpenWebText (10 مليار رمز) للتقطير.
الحفاظ على الأداء:
المعلم (Pythia-1B): الـ Perplexity (PPL) = 13.86.
التقطير الساذج: PPL > 100 (فشل).
خط الأساس Hedgehog (الاهتمام الخطي فقط): PPL = 14.89.
HedgeMamba (عملنا): P P L = 14.11.
النتيجة: يحقق نموذج Mamba المقطر أداءً مطابقاً تقريباً لمعلم الـ Transformer (ضمن 0.25 PPL) مع الحفاظ على تعقيد استنتاج خطي.
المهام اللاحقة: يتفوق النموذج على خط أساس Hedgehog ويقترب من أداء المعلم في مهام مثل ARC-Challenge وBoolQ وWinoGrande.
رؤى الاستئصال (Ablation Insights):
ميزانية الرموز (Token Budget): التقسيم الأمثل هو 10% للمرحلة الأولى / 90% للمرحلة الثانية. تخصيص جميع الرموز للمرحلة الثانية فقط (الضبط الدقيق فقط) يؤدي إلى أداء ضعيف، مما يثبت ضرورة خطوة التهيئة.
المكونات: وفر إضافة فرع البوابة (Gate branch) أكبر دفعة في الأداء، تلاها بارامترات خلاط الـ SSM ثم الالتفاف.
القياس (Scaling): يتحسن الأداء مع حجم النموذج (160M → 1B) وميزانية الرموز (1B → 10B)، مع عدم ملاحظة أي تشبع عند 10 مليارات رمز.
5. الأهمية
الكفاءة دون تضحية: يثبت هذا العمل إمكانية نقل معرفة نماذج Transformer الضخمة والمدرّبة مسبقاً إلى نماذج SSM ذات تعقيد خطي دون الحاجة لإعادة التدريب من الصفر أو التضحية بدقة كبيرة.
الجسر النظري: يضع رابطاً رياضياً ملموساً بين "الاهتمام الخطي" و"نماذجه فضاء الحالة (SSMs)"، موضحاً أن Mamba يمكن اعتباره شكلاً متخصصاً ومعبراً عن "الاهتمام الخطي" عند تهيئته بشكل صحيح.
وصفة عملية: تقدم وصفة "HedgeMamba" المقترحة مساراً قابلاً للتكرار وفعالاً حاسوبياً للمجتمع العلمي لتبني نماذج SSM، والاستفادة من النظام البيئي الواسع لنماذج Transformer الموجودة.
كفاءة الموارد: تطلبت عملية التقطير حوالي 10 مليارات رمز فقط (حوالي 2.7% من ميزانية تدريب المعلم)، مما يثبت أن التقطير عالي الجودة ممكن بموارد محدودة مقارنة بالتدريب المسبق.
باختينصار، توفر الورقة "وصفة" قوية لتحويل النماذج القائمة على "الاهتمام" (Attention) إلى نماذج قائمة على "Mamba"، مما يحل مشكلة عدم تطابق التهيئة التي أعاقت التقطير عبر الهياكل سابقاً.