← أحدث الأبحاث
🤖 machine learning

Fast MoE Inference via Predictive Prefetching and Expert Replication

تقترح هذه الورقة استراتيجية ديناميكية لتكرار الخبراء تتنبأ بالخبراء المثقلين بالأعباء وتكررهم لتمكين المعالجة المتزامنة، مما يحقق استفادة شبه كاملة من وحدة معالجة الرسومات وتسريعًا يصل إلى 3 أضعاف في استنتاج نماذج "خليط الخبراء" (MoE) مع الحفاظ على معظم أداء النموذج الأساسي.

المؤلفون الأصليون: Ankit Jyothish, Ali Jannesari, Aishwarya Sarkar, Joseph Zuber

نُشر 2026-05-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ankit Jyothish, Ali Jannesari, Aishwarya Sarkar, Joseph Zuber

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مطعماً ضخماً فائق السرعة يسمى "مزيج الخبراء" (Mixture of Experts - MoE). يمتلك هذا المطعم قائمة طعام ضخمة تضم مئات الطهاة المتخصصين (الخبراء)، حيث يكون كل طاهٍ بارعاً في طبق محدد للغاية.

عندما يطلب زبون ما، ينظر رئيس النادلين (الموجه - Router) إلى الطلب ويقرر أي طاهٍ متخصص يجب أن يطهو الوجبة. المشكلة تكمكمن في أن معظم الطلبات تذهب إلى عدد قليل من الطهاة المشهورين، بينما يظل 90% من الطهاط الآخرين جالسين دون فعل شيء، يحدقون في محطات عملهم الفارغة.

هذا يخلق مشكلتين كبيرتين:

  1. الخبراء المشغولون مثقلون بالأعباء: إذا طلب 50 زبوناً نفس الطبق، فسيتعين عليهم الانتظار في طابور طويل أمام ذلك الطاهي الواحد.
  2. الخبراء العاطلون عن العمل هدر للموارد: المطبخ ضخم جداً، لكن معظم المساحات والمعدات تقبع فارغة، مما يعد هدراً للمال والطاقة.

الطريقة القديمة مقابل الفكرة الجديدة

الطريقة القديمة (MoE القياسي):
يحاول المطبخ تجهيز جميع الطهاة في وقت واحد. ولكن نظرًا لأن الطهاة متخصصون للغاية، يصبح المطبخ مزدحماً بمحطات عمل فارغة، كما يتعرض الطهاة المشغولون لبعضهم البعض في اختناقات مرورية. هذا يجعل المطعم يعمل ببطء.

الحل السابق (SiDA-MoE):
حاول العلماء إيجاد طريقة أذكى: حيث تنبأوا بالطهاة الذين سيكونون مشغولين قبل وصول الزبائن، وأحضروا فقط هؤلاء الطهاة المحددين إلى الخط الأمامي. ساعد هذا في تحسين الوضع، ولكن إذا طلب 50 شخصاً نفس الطبق، فسيظل هؤلاء الطهاة القلائل عالقين في طابور.

الحل الجديد (MoE-MPMC):
يقترح مؤلفو هذه الورقة استراتيجية "التحضير المسبق التنبؤي وتكرار الخبراء". فكر في الأمر كـ مدير مطبخ فائق التنظيم يقوم بشيئين:

  1. الكرة البلورية (التحضير المسبق التنبؤي):
    بدلاً من انتظار وصول الطلب، يستخدم المدير كرة بلورية سريعة وبسيطة للغاية (تسمى SRU، وهي نوع من نماذج الذكاء الاصطناعي) لتخمين ما سيطلبه دفعة الزبائن التالية بالضبط.
  • التشبيه: الأمر يشبه طاهياً يعرف أن الجميع يطلب البيتزا كل يوم ثلاثاء في الساعة 6 مساءً. لذا، في الساعة 5:55 مساءً، يبدأ الطاهي في تحضير عجينة البيتزا قبل دخول أول زبون.
  1. جيش الاستنساخ (تكرار الخبير):
    هذا هو التغيير الجذري. إذا توقع المدير أن 50 شخصاً سيطلبون "تاكو حار"، فهو لا يحضر طاهياً واحداً للتاكو فحسب، بل يحضر 32 نسخة مستنسخة من ذلك الطاهي إلى الخط الأمامي فوراً.
  • التشبيه: تخيل لو كان عليك نقل 100 صندوق، وبدلاً من أن يحمل شخص واحد الصناديق واحداً تلو الآخر، قمت بسحرياً باستنساخ نفسك 32 مرة. الآن، 32 نسخة منك تنقل الصناديخ في نفس الوقت. يختفي الطابور، ويتم إنجاز العمل فوراً.

كيف يعمل الأمر في المطبخ

يعمل النظام عبر فريقين يعملان في وقت واحد:

  • الفريق (أ) (الطهاة): هم مشغولون بخدمة الدفعة الحالية من الزبائن باستخدام الطهاة المستنسخين.
  • الفريق (ب) (المتنبئون): بينما يعمل الفريق (أ)، ينظر الفريق (ب) إلى دفعة الزبائن التالية، مستخدماً الكرة البلورية لتخمين من سيحتاجون إليه، ويقوم بتجهيز النسخ المستنسخة للجولة القادمة.

ولأن النسخ المستنسخة تكون جاهزة قبل وصول الزبائن، فلن يضطر الزبائن للانتظار في طابور أبداً. المطبخ (رقاقة الكمبيوتر، أو GPU) يكون مشغولاً بنسبة 100% دائماً لأن هناك دائماً عدد كافٍ من الطهاة للتعامل مع الضغط.

النتائج

اختبرت الورقة هذا النظام على نماذج لغوية ضخمة (مثل العقول التي تقف وراء روبوتات الدردشة المتقدمة) مع 128 و256 خبيراً مختلفاً.

  • السرعة: أصبح المطعم أسرع بـ 3 مرات.
  • الكفاءة: انتقل المطبخ من انشغال بنسبة 1-10% إلى انشغال بنسبة تقارب 100%. لا مزيد من المساحات الضائعة أو الطهاة العاطلين.
  • الجودة: ظلت جودة الطعام (إجابات الذكاء الاصطناعي) جيدة كما كانت، مع فقدان ضئيل جداً في الدقة (حوالي 5-10%)، وهو ثمن بسيط مقابل كونها أسرع بكثير.

الملخص

ببساطة، تقول هذه الورقة: "لا تكتفِ بتخمين الخبير الذي تحتاجه؛ بل خمنه مبكراً، وإذا كنت تعتقد أن الكثير من الناس سيحتاجون إلى هذا الخبير، قم باستنساخ هذا الخبير حتى يتمكن الجميع من الحصول على خدمتهم في نفس الوقت". هذا يحول عملية بطيئة ومتعثرة إلى طريق سريع سلس وعالي السرعة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →