ملخص تقني: نقل المعلمات الفائقة لطبقات خليط الخبراء (Mixture-of-Experts)
1. بيان المشكلة
أصبحت طبقات خليط الخبراء (MoE) آلية حاسمة لتوسيع نطاق الشبكات العصبية الحديثة من خلال الفصل بين إجمالي عدد المعلمات القابلة للتدريب وبين المعلمات النشطة أثناء التمرير الأمامي. ومع ذلك، فإن تدريب نماذج MoE المتفرقة (sparse) يفرض تعقيدًا كبيرًا فيما يتعلق باختيار المعلمات الفائقة (HP). فخلافًا للنماذج الكثيفة (dense)، تُدخل بنيات MoE معلمات جديدة قابلة للتدريب (أوزان الموجه/router weights) وأبعادًا بنيوية جديدة (عدد الخبراء، وحجم الخبير)، مما يتطلب ضبطًا دقيقًا.
إن الضبط المباشر للمعلمات الفائقة (مثل معدل التعلم، ومقياس التهيئة، واضمحلال الوزن) عند المقاييس الكبيرة هو أمر غير مجدٍ حسابيًا. وبينما توجد تقنيات لنقل المعلمات الفائقة للنماذج المحولة (transformers) الكثيفة — والتي تسمح بتعميم المعلمات الفائقة المثلى الموجودة في النماذج الصغيرة على النماذج الأكبر — إلا أن هذه الطرق لم يتم تكييفها بصرامة مع ديناميكيات التوسع الخاصة لطبقات MoE المتفرقة. ويتمثل التحدي الجوهري في تحديد كيفية توسيع المعلمات الفائقة عند زيادة عرض النموذج، وعمقه، وعدد الخبراء، وحجم الخبير في آن واحد، دون الحاجة لإعادة الضبط عند كل مقياس، مع ضمان استقرار التدريب والأداء.
2. المنهجية
2.1. المعلمة المقترحة (Proposed Parameterization)
يقترح المؤلفون معلمة جديدة لنماذج المحولات ذات طبقات MoE، حيث يمددون معلمة CompleteP (التي تم تطويرها سابقًا للنماذج المحولة الكثيفة) لتشمل قواعد توسيع خاصة بـ MoE. والهدف هو تحديد مجموعة من القواعد التي تتنبأ بكيفية تغير قيم المعلمات الفائقة الخام (الانحراف المعياري للتهيئة σ ومعدل التعلم η) مع توسع أبعاد النموذج، بحيث تظل ديناميكيات التدريب متسقة.
يعتمد الاشتقاق على مبدأ المعلمة ذات التحديث الأقصى (μP)، والذي يتطلب أن تظل مكونات الشبكة (النشاطات المسبقة والتحديثات المتبقية) بمقدار O(1) عند التهيئة، وأن تتلقى تحديثات بمقدار Θ(1) لكل خطوة تدريب. ويمتد المؤلفون بهذا المبدأ إلى نماذج MoE عبر اشتراط تحقق شروط التحديث الأقصى ليس فقط لمخرجات الطبقة، بل لمكونات الخبير الفردية (معاملات الخلط ومخرجات الخبراء).
تشمل قواعد التوسع الرئيسية المستمدة لوحدة MoE ما يلي:
- أوزان الموجه (Router Weights): يتوسع معدل التعلم كـ η∝nembd−1. وتتوسع التهيئة كـ nembd−γ (حيث γ≥0.5).
- انحيازات الخبراء (Expert Biases): تُهيأ عند الصفر بمعدل تعلم ثابت η∝1 (مستقل عن عدد الخبراء)، بشرط ثبات التفرق (sparsity).
- أوزان MLP للخبراء:
- الرفع العلوي (Wup): σinit∝nembd−1/2، و η∝nembd−1.
- الإسقاط السفلي (Wdown): σinit∝αffn−1nembd−1/2، و η∝αffn−1nembd−1.
- هنا، يمثل αffn مضاعف الحجم المخفي للخبير بالنسبة لبعد التضمين (embedding dimension).
ومن الأهمية بمكان أن يثبت المؤلفون نسبة التفرق κ=nact/nexp (نسبة الخبراء النشطة) كقيمة ثابتة أثناء توسيع إجمالي عدد الخبراء (nexp) والخبراء النشطين (nact). وهذا يتناقض مع النهج الذي يثبت عدد الخبراء النشطين مع زيادة إجمالي عدد الخبراء.
2.2. التأسيس النظري: نظرية المجال المتوسط الديناميكية (DMFT)
لتبرير هذه القواعد التجريبية، يستخدم المؤلفون نظرية المجال المتوسط الديناميكية (DMFT). حيث يحللون ديناميكيات التدريب للشبكات المتبقية (residual networks) ذات طبقات MoE في الحد المتزامن للعرض اللانهائي (nembd)، والعمق (L)، وحجم الخبير (nhid)، وعدد الخبراء (nexp)، مع الحفاظ على تفرق التنشيط الثابت κ.
يكشف التحليل عن تسلسل هرمي جديد للمجال المتوسط مكون من ثلاثة مستويات:
- تمثيلات المجرى المتبقي (Residual Stream): مجال متوسط فوق مخرجات الخبراء.
- مخرجات الخبراء: مجال متوسط فوق عصبونات الخبراء الفردية.
- العصبونات الفردية: مجال متوسط داخل كل خبير.
يُظهر تحليل DMFT أنه بموجب المعلمة المقترحة، تكون ديناميكيات التدبية المحدودة هي:
- مستقلة عن نسبة FFN (αffn): لا تعتمد الديناميكيات على الحجم المحدد للخبراء بالنسبة لبعد التضمين، بشرط اتخاذ حد التوسع المشترك.
- تعتمد فقط على التفرق κ: تكون الديناميكيات متسقة عبر جميع معاملات التوسع طالما ظلت نسبة التفرق ثابتة.
- ثبات المقياس (Scale-Invariant): تطور إحصائيات ملخص الشبكة (مثل نوى الميزات لكل طبقة) متسق عبر المقاييس، مما يضمن نظريًا انتقال المعلمات الفائية بشكل موثوق.
2.3. الإعداد التجريبي
يتحقق المؤلفون من معلمتهم تجريبيًا باستخدام نماذج لغوية محولة (Transformer) من نوع Decoder-only على مجموعات بيانات FineWeb و C4.
- النماذج الأساسية: تم ضبطها على نماذج صغيرة تحتوي على حوالي 38 مليون معلمة نشطة.
- التوسع: تم التوسع إلى نماذج تصل إلى 2 مليار معلمة إجمالية، مع تغيير العرض، والعمق، وعدد الخبراء، وحجم الخبير.
- ميزانية الرموز (Token Budget): أُجريت التجارب على ميزانية رموز ثابتة قدرها 1 مليار رمز (2000 خطوة) لعزل ديناميكيات التدريب المبكرة، بالإضافة إلى آفاق زمنية أطول (تصل إلى 7.5 مليار رمز).
- المحسن (Optimizer): مُحسن Adam القياسي.
- توازن الحمل (Load Balancing): تم استخدام استراتيجية خالية من الخسارة المساعدة، حيث يتم تحديث انحيازات الخبراء مباشرة لتشجيع توازن الحمل دون إضافة حد تنظيم إلى دالة الخسارة.
3. المساهمات الرئيسية
- معلمة MoE: يوسع البحث معلمة CompleteP لتشمل نماذج MoE المتفرقة، موفرًا قواعد توسيع صريحة لأوزان الموجه، وانحيازات الخبراء، وأوزان MLP للخبراء عبر العرض، والعمق، وعدد الخبراء، وحجم الخبير.
- التبرير النظري عبر DMFT: يقدم المؤلفون أساسًا نظريًا رصينًا لمعلمتهم باستخدام DMFT. وقد اشتقوا وصفًا صريحًا لديناميكيات التدريب في حد العرض/العمق اللانهائي، مثبتين أن الديناميكيات تتقارب إلى نظام مستقر وثابت المقياس يعتمد فقط على التفرق، وليس على التوسع المحدد لأبعاد الخبراء.
- التحقق التجريبي من نقل المعلمات الفائقة: تثبت الدراسة أن المعلمات الفائقة المثلى (معدل التعلم ومقياس التهيئة) التي تم تحديدها في النماذج الصغيرة (38 مليون معلمة نشطة) تنتقل بشكل موثوق إلى نماذج أكبر بكثير (تصل إلى 2 مليار معلمة إجمالية) عبر مختلف الأبعاد المعمارية.
- رؤى معمارية: يتحقق المؤلفون تجريبيًا من أنه، تحت معلمتهم، يؤدي زيادة عدد الخبراء (مع الحفاظ على إجمالي المعلمات ثابتًا) إلى أداء أفضل من زيادة حجم الخبراء الفرديين. وتتماشى هذه النتيجة مع الأدبيات الحديثة ولكن تم تحقيقها هنا دون الحاجة إلى عمليات بحث مكلفة للمعلمات الفائقة عند كل مقياس.
4. النتائج
- نقل موثوق للمعلمات الفائقة: بموجب قواعد التوسع المقترحة، تنتقل معدلات التعلم المثلى للانظمة الأساسية وانحرافات التهيئة بشكل فعال عبر النماذج التي تتراوح من 51 مليون إلى 2 مليار معلمة إجمالية. وتتقارب منحنيات الخسارة للنماذج الموسعة مع النموذج الأساسي في التكرارات الأولى قبل أن تتباعد (حيث تحقق النماذج الأكبر خسارة أقل).
- الاستقرار: تضمن المعلمة ديناميكيات تدريب مستقرة، بما في ذلك توازن حمل الخبراء المنتظم، حتى عند توسيع عدد الخبراء. ويشير المؤلفون إلى أن التدريب المسبق لـ MoE حساس بشكل خاص للمعلمات ذات المقياس الثابت (المضاعفات التي تُعامل كـ Θ(1))، وأن ضبط هذه المعلمات أمر بالغ الأهمية للاستقرار.
- الأداء: تحقق النماذج المدربة باستخدام معلمات فائقة صفرية (zero-shot) - أي المنقولة من النماذج الصغيرة - أداءً تنافسيًا مقابل النماذج الكثيفة (مثل GPT-2 small/medium) عند مطابقتها في عدد المعلمات النشطة.
- عدد الخبراء مقابل الحجم: تؤكد التجارب أن زيادة عدد الخبراء أكثر كفاءة في استخدام المعلمات من زيادة حجم الخبير عند ثبات عدد المعلمات. ويستمر هذا التفوق حتى في آفاق التدريب الأطول (5 مليار رمز).
- حساسية التفرق: تسلط الدراسة الضوء على أن نقل المعلمات الفائقة صالح فقط عندما تكون نسبة التفرق κ ثابتة. إن توسيع عدد الخبراء مع تثبيت عدد الخبراء النشطين (إرسال κ→0) يؤدي إلى كسر قابلية انتقال المعلمات الفائقة المثلى.
5. الأهمية والادعاءات
يزعم البحث تقديم إطار عمل عملي وصارم لتوسيع نماذج MoE. ومن خلال الجمع بين المعلمة التجريبية وتحليل DMFT، يقدم المؤلفون طريقة لـ:
- تقليل تكاليف التدريب: تمكين اختيار المعلمات الفائقة المثلى لنماذج MoE واسعة النطاق عن طريق ضبط النماذج الأساسية الصغيرة والزهيدة التكلفة فقط.
- ضمان الاستقرار: توفير قواعد تمنع عدم استقرار التدريب (مثل انهيار الخبراء أو التباعد) الشائع في تدريب MoE المتفرق.
^ توجيه التصميم المعماري: تقديم أدلة نظرية وتجريبية على أن زيادة عدد الخبراء أفضل من زيادة حجم الخبير تحت ظل تفرق ثابت، مما يساعد في تصميم نماذج واسعة النطاق وفعالة.
يقر المؤلفون بالقيود، مشيرين إلى أن العمل الحالي يركز على معدل التعلم والتهيئة، تاركًا المعلمات الفائقة الأخرى (حجم الدفعة، اضمحلال الوزن، جداول معدل التعلم) للبحث المستقبلي. كما يشيرون إلى أنه بينما يدعم تحليل DMFT حد العرض اللانهائي، فإن سلوك عمليات النقل ذات العرض الصغير يتطلب مزيدًا من الدراسة النظرية. علاوة على ذلك، لا يدعي البحث حل "قوانين التوسع المثلى للحوسبة" (مثل أسس Chinchilla) لـ MoE، حيث أن مقايضة العمليات الحسابية (FLOPs) مقابل الأداء تختلف بشكل كبير عن النماذج الكثيفة بسبب قيود العتاد الناجمة عن التفرق.
باختصار، يضع هذا العمل معلمة تأسيسية تسمح بالتوسع الموثوق للمعلمات الفائقة من نماذج MoE الصغيرة إلى الكبيرة، استنادًا إلى نظرية مجال متوسط ثلاثية المستويات لديناميكيات التدريب.