← أحدث الأبحاث
💬 NLP

A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAMΔ\Delta Integration into Upcycled MoE

تقدم هذه الورقة طريقة فعالة من حيث استهلاك البيانات تسمى \method تقوم بترقية النماذج الكثيفة إلى بنيات "خليط الخبراء" (Mixture-of-Experts) وتدمج فروق المعلمات (parameter deltas) ما بعد التدريب لتوسيع القدرات متعددة اللغات دون الحاجة إلى تدريب مسبق مستمر مكلف أو محاذاة معقدة، مما يوازن بفعالية بين اكتساب لغات جديدة والحفاظ على قدرات النموذج الأصلية.

المؤلفون الأصليون: Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة البحث "DeltaMoE: مسار فعال للبيانات نحو النماذج اللغوية الكبيرة متعددة اللغات" باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة الكبرى: معضلة "الطاهي ثنائي اللغة"

تخيل أن لديك طاهياً (نموذج لغوي كبير) عالمياً، وهو خبير في طهي الأطباق الإنجليزية، وهو بارع جداً في ذلك. الآن، تريد من هذا الطاهي أن يتعلم كيفية طهي الأطباق المجرية، والصربية، والبنغالية أيضاً.

الطريقة التقليدية للقيام بذلك هي إرسال الطاهي إلى مدرسة طبخ ضخمة لفترة طويلة (تسمى التعلم المسبق المستمر - Continued Pre-Training). حيث يدرس آلاف كتب الطبخ بتلك اللغات الجديدة. ولكن هناك مشكلة:

  1. الطاهي "النسّاء": إذا درس بجد في اللغات الجديدة، فقد يبدأ في نسيان وصفات الإنجليزية الأصلية.
  2. الطاهي "المتوسط": إذا حاولت أن تكون حذراً وتمزج معرفته الإنجليزية القديمة مع الأشياء الجديدة بلطف، سينتهي به الأمر بكونه متوسط المستوى في كليهما. لن ينسى الإنجليزية، لكنه أيضاً لن يصبح جيداً جداً في اللغات الجديدة.

هذه هي "المقايضة" التي تتحدث عنها الورقة: عادة ما يتعين عليك الاختيار بين تعلم لغات جديدة بشكل جيد أو الحفاظ على مهاراتك القديمة مثالية. نادراً ما تحصل على كليهما.

الحل: DeltaMoE (نهج "المطبخ المتخصص")

يقترح المؤلفون طريقة جديدة تسمى DeltaMoE. بدلاً من محاولة جعل الطاهي أكثر ذكاءً عبر إعادة تدريب دماغه بالكامل، فإنهم يمنحون الطاهي ترقية لمطبخ متخصص.

إليك كيف يعمل ذلك في ثلاث خطوات بسيطة:

الخطوة 1: بناء مطبخ "خليط من الخبراء" (Upcycling)

تخيل أن مطبخ الطاهي قد تم توسيعه. بدلاً من وجود طاولة واحدة كبيرة يحدث فيها كل شيء، قاموا ببناء مطبخ "خليط من الخبراء" (Mixture of Experts - MoE).

  • الطاولة الأصلية (الخبير المجمد): يحتفظ الطاهي بطاولته الإنجليزية الأصلية كما كانت تماماً. إنهم يقفلونها. لا شيء يتغير هنا. هذا يضمن أنه لن ينسى وصفاته الإنجليزية أبداً.
  • الطاولات الجديدة (الخبراء القابلون للتدريب): قاموا ببناء ثلاث طاولات جديدة تماماً مخصصة للغات الجديدة (المجرية، الصربية، البنغالية).
  • رئيس النادلين (الموجه - The Router): قاموا بتعيين رئيس نادلين ذكي. عندما يطلب زبون طبقاً إنجليزياً، يرسله النادل إلى الطاولة الأصلية. وعندما يطلب زبون طبقاً مجرياً، يرسله النادل إلى الطاولة المجرية.

الطاهي يتعلم فقط على الطاولات الجديدة. أما الطاولة الأصلية فتظل مجمدة، لذا تظل مهارات الإنجليزية محفوظة تماماً.

الخطوة 2: "الترقيع الدلتا" (النقل السحري)

الآن، الطاولات الجديدة جيدة في طهي الطعام، لكنها لا تعرف كيفية التحدث إلى الزبائن بأدب أو اتباع التعليمات المعقدة (وهذا ما يسمى المواءمة - Alignment). عادةً، سيتعين عليك تدريبها لشهور لتعلم ذلك.

خدعة الورقة الذكية هي دمج الدلتا (Delta Merging).

  • تخيل أن هناك طاهياً مشهوراً آخر (نموذج "تعليمات" - Instruct model مدرب مسبقاً) وهو بالفعل خبير في التحدث إلى الزبائن واتباع القواعد، لكنه يتحدث الإنجليزية فقط.
  • بدلاً من تعليم الطاولات الجديدة من الصقة، يأخذ المؤلفون "الفرق" (Delta) بين الطاهي المشهور وأصله الأساسي. فكر في الأمر كأنه "وصفة للأدب" مكتوبة على ملاحظة لاصقة.
  • يقومون بلصق هذه الملاحظة اللاصقة على الطاولات الجديدة. ولأن الطاولات الجديدة بُنيت من نفس "العجينة" الخاصة بالأصل، فإن "وصفة الأدب" هذه تعمل فوراً.

النتيجة: يمكن للطاولات الجديدة الآن طهي الطعام المجري والتحدث بأدب، دون الحاجة إلى المرور بعملية التدريب المكلفة والمستهلكة للبيانات.

لماذا هذا أفضل من الطريقة القديمة؟

اختبرت الورقة هذا الأسلوب مقابل طرق أخرى ووجدت:

  1. لا مزيد من المقايضات:

    • الطريقة القديمة (أ) (المتوسط): حاولت مزج المهارات القديمة والجديدة. النتيجة: أصبح الطاهي أسوأ في الإنجليزية وجيد فقط في اللغات الجديدة.
    • الطريقة القديمة (ب) (الدلتا المباشرة): حاولت فقط لصق المهارات الجديدة فوق الأصل. النتيجة: أصبح الطاهي رائعاً في اللغات الجديدة ولكنه نسي كيفية التحدث بالإنجليزية.
    • DeltaMoE: الطاهي رائع في الإنجليزية (لأن الطاولة الأصلية كانت مجمدة) ورائع في اللغات الجديدة (لأن الطاولات الجديدة تعلمت اللغات وحصلت على "ترقيع الأدب").
  2. كفاءة البيانات:

    • تحتاج الطرق الأخرى إلى ملايين الأمثلة لتعليم النموذج كيف يكون مهذباً في لغة جديدة.
    • يحصل DeltaMoE على هذه القدرة مجاناً عن طريق "ترقيعها" من نموذج موجود. وهذا يوفر كمية هائلة من الوقت وقدرة الحوسبة.
  3. القابلية للتوسع:

    • أظهر المؤلفون أنه حتى لو أضفت لغات أكثر (مثل 8 بدلاً من 3)، فإن النظام لا ينكسر. رئيس النادلين (الموجه) يتعلم فقط إرسال الطلبات إلى الطاولة الصحيحة، ويظل النظام مستقراً.

الخلا الخلاصة

DeltaMoE يشبه منح طاهٍ ماهر مطبخاً متخصصاً ونموذجياً.

  • يحتفظ بمساحة عمله الأصلية دون مساس لحماية مهاراته الأساسية.
  • يضيف مساحات عمل جديدة للغات الجديدة.
  • ينقل "مهارات خدمة العملاء" فوراً إلى مساحات العمل الجديدة دون إعادة تدريب.

يسمح هذا للنماذج اللغوية بالتحدث بالعديد من اللغات الجديدة بطلاقة وأدب، دون فقدان ذكائها الأصلية أو الحاجة إلى كمية هائلة من البيانات الجديدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →