← أحدث الأبحاث
🤖 machine learning

Lynx: Enabling Efficient MoE Inference through Dynamic Batch-Aware Expert Selection

يُعد Lynx نظاماً غير مرتبط بنوع محدد من أعباء العمل، يتيح استنتاجاً فعالاً لنموذج "خليط الخبراء" (MoE) عبر استغلال الانحرافات في التنشيط الناتجة عن التدريب واستخدام تقنية "AffinityBinning" المبتكرة لإعادة تعيين تخصيص الرموز للخبراء ديناميكياً، مما يقلل عدد الخبراء المستدعين ويحسن معدل الإنتاجية بما يصل إلى 1.30 ضعفاً دون المساس بالدقة بشكل كبير.

المؤلفون الأصليون: Vima Gupta, Jae Hyung Ju, Kartik Sinha, Ada Gavrilovska, Anand Padmanabha Iyer

نُشر 2026-05-20
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Vima Gupta, Jae Hyung Ju, Kartik Sinha, Ada Gavrilovska, Anand Padmanabha Iyer

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مطعماً ضخماً وراقياً يسمى "The MoE Kitchen" (مطبخ الخبراء المتخصصين).

في هذا المطبخ، بدلاً من وجود شيف واحد عملاق يحاول طهي كل طبق بمفرده، لديك فريق مكون من 64 مساعد شيف متخصص (الخبراء). وهناك نادل رئيسي (الموجه - Router) ينظر إلى كل طلب (الرمز - Token) ويقرر أي 8 شيفات محددين سيقومون بطهي هذا الطبق.

هذا الإعداد عبقري لأنه فعال: فأنت لست بحاجة لدفع أجور جميع الـ 64 شيف للعمل على كل طلب. أنت تدفع فقط مقابل الثمانية الذين هم في أمس الحاجة إليهم. هكذا تعمل نماذج الذكاء الاصطناعي الحديثة مثل Qwen أو Llama؛ فهي ضخمة، لكنها لا "تستيقظ" إلا لجزء صغير من عقلها لكل كلمة تولدها.

المشكلة: ازدحام ساعة الذروة

يشرح البحث مشكلة رئيسية تحدث عندما يصبح المطعم مزدحماً (وهو ما يسمى بـ التجميع - Batching).

عندما يكون لديك عميل واحد فقط، يرسل النادل الرئيسي طلبه إلى 8 شيفات محددين. الأمر سهل.
لكن عندما تصل دفعة من 16 عميلاً، ينظر النادل الرئيسي إلى الطلبات الـ 16 جميعها. ولأن كل عميل مختلف عن الآخر، ينتهي الأمر بالنادل وهو يحتاج إلى استدعاء تقريباً جميع الـ 64 شيفاً للتعامل مع هذه المجموعة.

عنق الزجاجة:
المطبخ منظم بحيث أن المكونات (معرفة الشيفات) مخزنة في مخزن ضخم فائق السرعة (ذاكرة وحدة معالجة الرسومات - GPU Memory). وللطهي، يجب على الشيفات الركض إلى المخزن لجلب مكوناتهم الخاصة.

  • المشكلة: عندما يصل 16 عميلاً، يغرق المخزن بالطلبات. يقضي الشيفات وقتاً في الركض ذهاباً وإياباً لجلب المكونات أكثر مما يقضونه في الطهي الفعلي. يتباطأ المطبخ لأن "الركض" (نطاق عرض الذاكرة - memory bandwidth) هو العائق، وليس "الطهي" (الحوسبة).
  • النتيجة: على الرغم من أن الذكاء الاصطناعي من المفترض أن يكون سريعاً وفعالاً، إلا أنه يتباطأ بشكل كبير عند التعامل مع طلبات متعددة في وقت واحد لأنه عالق في عملية جلب البيانات.

الحل: LYNX (النادل الذكي)

ابتكر المؤلفون نظاماً جديداً يسمى LYNX. تخيل LYNX كمدير ذكي للغاية وديناميكي يتدخل فقط عندما يكون المطبخ مشغولاً (أثناء مرحلة "فك التشفير" - decode phase، وهي تشبه خدمة الطعام في المطعم وجبة بوجبة واحدة في كل مرة).

لا يقوم LYNX بطرد أي شيف أو تغيير قائمة الطعام. بدلاً من ذلك، يستخدم حيلة ذكية تسمى AffinityBinning (طريقة مبتكرة تعني "التجميع حسب الثقة").

إليك كيف يعمل LYNX خطوة بخطوة:

  1. "فحص الثقة":
    أحياناً، يكون النادل الرئيسي متأكداً بنسبة 100% أن الشيف (أ) هو الأفضل لهذا الطبق. وفي أحيان أخرى، يكون النادل غير متأكد ويختار الشيف (ب) لمجرد أن القواعد تقول "يجب اختيار 8 أشخاص مختلفين". وجد البحث أن هذه الاختيارات "غير الواثقة" غالباً ما تكون مكررة وغير ضرورية.
  • مثال توضيحي: إذا سألت صديقاً عن توصية بفيلم، وقال لك: "لست متأكداً، ولكن ربما الفيلم (س) أو الفيلم (ص)"، فهو ليس ملتزماً بأي منهما حقاً. إذا سألته مرة أخرى، فقد يختار الفيلم (س) مجدداً.
  1. استراتيجية "التجميع" (Binning):
    يقوم LYNX بالنظر في درجات الثقة الخاصة بالنادل. يقوم بتجميع الطلبات في "حاويات" (Buckets).
  • الثقة العالية: "هذا الطلب يجب أن يذهب إلى الشيف (أ)". (هنا يترك LYNX الأمر كما هو دون تدخل).
  • الثقة المنخفضة: "هذا الطلب هو نوع ما للشيف (ب)". (هنا يقول LYNX: "في الواقع، دعونا نرسل هذا الطلب إلى الشيف (أ) بدلاً من ذلك، لأن الشيف (أ) موجود بالفعل في المطبخ للطلبات الأخرى").
  1. إعادة التعيين الكبرى:
    يأخذ LYNX تلك الطلبات "منخفضة الثقة" ويعيد توجيهها إلى الشيفات الذين يتم استخدامهم بالفعل في الدفعة الحالية.
  • السحر يكمن هنا: بدلاً من الركض إلى المخزن لجلب المكونات لـ 64 شيفاً مختلفاً، يحتاج المطبخ الآن فقط للركض إلى المخزن لجلب المكونات لـ 30 شيفاً مثلاً.
  • النتيجة: يقضي الشيفات وقتاً أقل في الركض ووقتاً أكثر في الطهي. ويصبح المطبخ أسرع بكثير.

لماذا هذا الأمر مميز؟

يسلط البحث الضوء على ثلاثة أسباب رئيسية تجعل LYNX أمراً هاماً:

  • إنه "مستقل عن نوع العمل" (Workload-Agnostic): لا يحتاج LYNX إلى التدريب على نوع معين من العملاء أو قوائم الطعام. إنه يفهم النمط فوراً في كل مرة. إنه يشبه المدير الذي يتعلم عادات الحشود فوراً دون الحاجة إلى دليل تعليمات.
  • إنه "لا يفسد أي شيء": لا يقوم LLynX بطرد الشيفات أو تغيير الوصفة. إنه فقط يعيد ترتيب من يفعل ماذا لهذا اللحظة المحددة. يوضح البحث أن "طعم" الطعام (إجابات الذكاء الاصطناني) يظل بنفس الجودة، بل وأحياناً يكون أفضل، لأنه يمنع إجبار الشيفات على طهي أطباق ليسوا واثقين منها.
  • إنه "يتوافق مع الأنظمة الأخرى": يمكن إضافة LYNX فوق تقنيات تسريع أخرى (مثل تصغير مآزر الشيفات أو إرسالهم إلى مبنى آخر) لجعلهم أسرع.

النتائج

عندما اختبر المؤلفون هذا النظام على نماذج ذكاء اصطناعي حقيقية (مثل Qwen و Mixtral و Llama) في مهام مثل البرمجة والرياضيات والاستنتاج:

  • السرعة: أصبح النظام أسرع بمقدار 1.3 مرة (زيادة في السرعة بنسبة 30%) في أسوأ الحالات.
  • الدقة: كانت الإجابات بنفس الدقة، أو حتى أفضل قليلاً. في أسوأ الحالات، انخفضت الدقة بأقل من 1%، وهو أمر يكاد لا يُلاحظ.
  • الكفاءة: سمح النظام بمعالجة المزيد من العملاء في وقت واحد دون تباطؤ.

الملخص

LYNX هو بمثابة شرطي مرور لمطبخ الذكاء الاصطناعي المزدحم. يلاحظ أنه عندما تأتي مجموعة من الطلبات، يضيع المطبخ وقتاً في الركض إلى المخزن لجلب مكونات لعدد كبير جداً من الشيفات المختلفين. لذا، يقوم بذكاء بإعادة توجيه الطلبات "المشكوك فيها" إلى الشيفات الذين يعملون بالفعل، مما يقلل من الازدحام ويخرج الطعام بشكل أسرع، وكل ذلك دون تغيير قائمة الطعام أو طرد أي شخص.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →