← أحدث الأبحاث
💻 computer science

MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

تقترح هذه الورقة إطار عمل MoE-GRPO، وهو إطار للتعلم المعزز يعمل على تحسين توجيه الخبراء في نماذج الرؤية واللغة القائمة على خليط الخبراء (Mixture-of-Experts) من خلال صياغة اختيار الخبير كمسألة اتخاذ قرار متسلسل باستخدام تحسين السياسة النسبية للمجموعات (Group Relative Policy Optimization) والتوجيه المدرك للنماط، مما يعزز تنوع الخبراء وتخصص المهام مع التخفيف من حدة الإفراط في التخصيص.

المؤلفون الأصليون: Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim

نُشر 2026-03-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فريقاً ضخماً من المتخصصين الأذكياء للغاية (مثل مكتبة عملاقة من الخبراء) يعملون معاً للإجابة على الأسئلة المتعلقة بالصور والفيديوهات. يُطلق على هذا الفريق اسم نموذج اللغة والرؤية (Vision-Language Model - VLM).

في الماضي، وللحفاظ على سرعة وكفاءة هذا الفريق، استخدم المدير (الكمبيوتر) قاعدة صارمة للغاية: "لكل سؤال، اختر أفضل خبيرين من القائمة وتجاهل البقية." وهذا ما يسمى توجيه Top-K (Top-K Routing).

المشكلة: "المدير الممل"

المشكلة في هذه القاعدة الصارمة هي أن المدير كسول ويمكن التنبؤ بتصرفاته.

  • الإفراط في التخصيص (Overfitting): المدير يختار دائماً نفس "الخبيرين المفضلين" لكل نوع من الأسئلة. فإذا كان السؤال عن كلب، سيختار المدير دائماً "خبير الكلاب" و"خبير الحيوانات"، حتى لو كان "خبير الفن" أو "خبير المنطق" قد يقدم إجابة أفضل.
  • الفرص الضائعة: لأن المدير لا يجرب تركيبات مختلفة أبداً، فإن الفريق لا يتعلم أبداً أن مزيجاً معيناً من الخبراء قد يكون أفضل في بعض الأحيان. يقع الفريق في فخ التكرار، معتمداً بشكل مفرط على عدد قليل من الأشخاص بينما يظل بقية أعضاء الفريق في حالة خمول.

الحل: MoE-GRPO (المدرب الذكي)

قدم مؤلفو هذه الورقة طريقة جديدة لإدارة الفريق تسمى MoE-GRPO. بدلاً من القاعدة الصارمة، استخدموا تعلم تعزيزي (Reinforcement Learning) يشبه مدرب الرياضة الذي يتعلم من خلال التجربة والخطأ.

إليك كيف يعمل ذلك، باستخدام تشبيه بسيط:

1. لعبة "المحاكاة" (التجربة والخطأ)

تخيل أن المدير لديه سؤال: "لماذا السماء زرقاء؟"

  • الطريقة القديمة (Top-K): يختار المدير فوراً الخبيرين اللذين يعتقد أنهما الأفضل ثم يكتب الإجابة. وإذا كانت الإجابة خاطئة، فسيحاول مجدداً بنفس الخبيرين.
  • الطريقة الجديدة (MoE-GRPO): يقوم المدير بتشغيل 8 عمليات محاكاة (rollouts) مختلفة في وقت واحد.
    • المحاكاة 1: تختار "خبير الفيزياء" و"خبير الفن".
    • المحاكاة 2: تختار "خبير الغلاف الجوي" و"خبير التاريخ".
    • المحاكاة 3: تختار "خبير الضوء" و"خبير الرياضيات".
    • ... وهكذا.

2. نظام المكافأة (لوحة النتائج)

بعد انتهاء المحاكات الثمانية، يقوم المدرب بفحص الإجابات.

  • إذا نجحت المحاكاة 1 في تقديم الإجابة الصحيحة، يمنحها المدرب درجة عالية (مكافأة).
  • إذا فشلت المحاكاة 2، يحصل على درجة منخفضة.

3. تعلم أفضل فريق (تحسين السياسة)

المدرب لا يكتفي باختيار الفائز فحسب؛ بل يحلل لماذا فاز هذا الفريق.

  • "لقد نجحت المحاكاة 1 لأننا اخترنا الفيزياء والفن معاً!"
  • "فشلت المحاكاة 2 لأن التاريخ ليس مفيداً لهذا السؤال."
  • يقوم المدرب بعد ذلك بتحديث عقل المدير: "في المرة القادمة، أعطِ الأولوية للفيزياء والفن لأسئلة السماء."

مع مرور الوقت، يتوقف المدير عن التخمين ويتعلم التركيبة المثالية من الخبراء لكل نوع من أنواع الأسئلة.

السر الكامن: "التوجيه المدرك للنمط" (Modality-Aware Guidance)

كان هناك خطر واحد: ماذا لو حاول المدير اختيار "خبير الطبخ" للإجابة على سؤال حول فيديو لحادث سيارة؟ سيكون ذلك إضاعة للوقت.

لإصلاح ذلك، أضاف المؤلفون مرشداً مدركاً للنمط (Modality-Aware Guide).

  • فكر في الأمر كـ شرطي مرور عند مدخل غرفة الخبراء.
  • إذا كان المدخل عبارة عن صورة، يقوم شرطي المرور بمنع الخبراء "المتخصصين في النصوص فقط" من دخول الغرفة، ويقول لهم: "ليس هذا عملكم اليوم!"
  • إذا كان المدخل نصاً، يقوم شرطي المرور بمنع الخبراء "البصريين".
  • هذا يمنع المدير من إضاعة الوقت في تجربة تركيبات عشوائية لا معنى لها، مما يجعل عملية التعلم أسرع وأكثر استقراراً.

النتائج: لماذا يهم هذا؟

عندما اختبروا هذا النظام الجديد:

  1. إجابات أفضل: حصل النموذج على أسئلة أكثر صحيحة مقارنة بنظام "Top-K" القديم.
  2. تقليل الملل: تم استخدام الخبراء بشكل أكثر توازناً. فبدلاً من قيام نفس الخبيرين بكل العمل، تمكن خبراء مختلفون من التألق بناءً على المهمة.
  3. القدرة على التعميم: أصبح النموذج أكثر ذكاءً في التعامل مع أنواع جديدة من الأسئلة التي لم يسبق له رؤيتها، لأنه تعلم كيفية مزج وتوفيق الخبراء بمرونة بدلاً من مجرد حفظ قائمة ثابتة.

باختوند (الخلاصة)

MoE-GRPO يشبه ترقية مدير الفريق من تابع لقواعد جامدة إلى مدرب استراتيجي. فبدلاً من اختيار نفس الشخصين لكل مهمة بشكل أعمى، يقوم المدرب بتجربة العديد من تركيبات الفرق، ويرى أي منها يفوز، ويتعلم التشكيلة المثالية لكل تحدٍ محدد. هذا يجعل الذكاء الاصطناعي أكثر ذكاءً، وكفاءة، وأقل عرضة للوقوع في الروتين.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →