← أحدث الأبحاث
💻 computer science

HetRoute Heterogeneous and Cost-aware Collaborative Routing Framework for Distributed Edge MoE Inference

تقترح هذه الورقة HetRoute، وهو إطار عمل للتوجيه التعاوني لاستنتاج نماذج خليط الخبراء (MoE) الموزعة عند الحافة، والذي يوحد تكاليف الإرسال والحوسبة والجودة في نموذج واحد لتحسين وضع الخبراء والتوجيه عبر الإنترنت، محققاً بذلك تخفيضات كبيرة في زمن الاستجابة وحركة المرور مع الحفاظ على قيود الجودة.

المؤلفون الأصليون: Xin Yuan, Ning Li, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang

نُشر 2026-08-04
📖 7 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Xin Yuan, Ning Li, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز ضخم ومعقد، لكن قطع اللغز مبعثرة عبر أحياء في منازل مختلفة. بعض هذه المنازل تمتلك حواسيب فائقة السرعة، وأخرى تمتلك حواسيب بطيئة، وبعضها متصل بألياف ضوئية بسرعة البرق بينما يرتبط البعض الآخر بطرق ترابية وعرة وبطيئة. في عالم الذكاء الاصطناعي، هذا هو بالضبط ما يحدث عندما نحاول تشغيل نماذج "خليط الخبراء" (Mixture-of-Experts - MoE) الضخمة. هذه النماذج هي عقول ذكاء اصطناعي هائلة لا تستخدم كل جزء منها لكل سؤال؛ بل توقظ فقط بضعة أجزاء "خبراء" محددة لحل المشكلة. التحدي يكمن في معرفة أي الخبراء يجب إيقاظهم وأين ترسل السؤال ليعود الجواب سريعاً، دون التعثر في الازدحام المروري أو فقدان الدقة. إذا أرسلنا السؤال ببساطة إلى أقرب منزل، فقد يكون بطيئاً لأن حاسوب ذلك المنزل متعب أو أن قرصه الصلب ممتلئ. وإذا أرسلناه إلى مكان بعيد، فقد يعلق في ازدحام مروري على طريق بطيء. لقد حاول العلماء إيجاد الطريقة المثالية لتوجيه هذه الأسئلة، لكن معظم الطرق السابقة كانت تشبه رجال المرور الذين ينظرون إلى سيارة واحدة فقط في كل مرة، أو يهتمون فقط بمدى قرب المنزل، متجاهلين سرعة الطريق أو حالة الحاسوب في الداخل.

يقدم هذا البحث نظاماً جديداً وأكثر ذكاءً يسمى HetRoute. فكر في HetRoute كخدمة توصيل منظمة للغاية لا تنظر فقط إلى منزل واحد أو طريق واحد، بل تنظر إلى مسار التوصيل بالكامل لقطعة لغز واحدة في آن واحد. إنه يأخذ كل شيء في الاعتبار: مدى سرعة الطرق بين المنازل، وقوة الحواسيب داخلها، وما إذا كان الحاسوب مشغولاً حالياً (مثل طابور من الناس ينتظرون)، وحتى ما إذا كان الحاسوب يستخدم نسخة "مضغوطة" من قطعة اللغز لتوفير المساحة (مما قد يجعل الإجابة أقل مثالية بقليل). يقوم HetRoute بوضع خطة موحدة لمجموعة الخبراء المطلوبة لسؤال واحد، بدلاً من اتخاذ قرارات منفصلة وجشعة لكل خبير على حدة. ومن خلال القيام بذلك، وجد أنه يمكنه جعل إجابات الذكاء الاصطناعي تصل أسرع بنسبة تصل إلى 59.0% في المتوسط، وتقليل أسوأ حالات التأخير بنسبة 58.0%. كما أنه يقلل من كمية البيانات التي تنتقل بين المنازل بنسبة 72.1%، مع الحفاظ على جودة الإجابات لتكون قريبة جداً من النسخة الأصلية غير المضغوطة.

المشكلة: الذكاء الاصطناعي "الذكي" الذي يتوه في الطريق

لفهم سبب أهمية Het-Route، نحتاج أولاً إلى فهم نموذج "خليط الخبراء" (MoE). تخيل مكتبة ضخمة حيث كل كتاب هو "خبير" في موضوع معين. عندما تطرح سؤالاً، لا تقرأ المكتبة كل الكتب؛ بل تسحب فقط الكتب القليلة العليا ("Top-k") الأكثر صلة بالموضوع. هذا فعال لأنك لا تضيع الوقت في قراءة كتب عن الطبخ بينما تسأل عن الرياضيات.

ومع ذلك، في العالم الحقيقي، غالباً ما تكون هذه المكتبات مقسمة عبر العديد من الخوادم (الحواسب) الموجودة في أماكن مختلفة، مثل خوادم الحافة (edge servers) القريبة منك. عندما يصل سؤال، قد يكون "خبراء Top-k" المطلوبون منتشرين عبر ثلاثة خوادم مختلفة. الطريقة القديمة للتعامل مع هذا كانت تشبه طلب شخص من صديق أن يركض إلى ثلاثة منازل مختلفة ليحضر ثلاثة كتب مختلفة. إذا ركض الصديق إلى أقرب منزل أولاً، فقد يجد الكتاب مغلقاً في قبو (مخزن على وحدة معالجة مركزية CPU بطيئة) ويضطر للانتظار حتى يحصل على المفتاح. أو، قد يركض إلى منزل بعيد يحتوي على الكتاب على رف عالي السرعة (في ذاكرة GPU سريعة)، لكن الطريق هناك مزدحم بالمرور.

حاولت الطرق السابقة حل هذه المشكلة إما عن طريق:

  1. البقاء محلياً: المحاولة دائماً لاستخدام الخبراء الموجودين في أقرب خادم، حتى لو كان ذلك الخادم بطيئاً أو مشغولاً.
  2. الاختيار الجشع (Greedy Selection): اختيار "أفضل" خادم لكل خبير بشكل فردي، دون إدراك أن اختيار الأفضل للخبير (أ) قد يجبر الخبير (ب) على سلوك مسار سيء، مما يبطئ المجموعة بأكملها.

يجادل البحث بأن هذه الطرق القديمة معيبة لأنها تعامل الخبراء كمسافرين مستقلين. في الواقع، هم فريق. إذا كان أحد أعضاء الفريق بطيئاً، فإن الفريق بأكمب سيكون بطيئاً.

الحل: "قائد الفريق" الخاص بـ HetRoute

يعمل HetRoute كقائد فريق بارع يخطط للمهمة بأكملها قبل أن يغادر أي شخص خط البداية. إنه يستخدم "نموذج تكلفة موحد"، وهو طريقة منمقة للقول بأنه يمتلك بطاقة تقييم واحدة تزن أربعة أشياء مختلفة في آن واحد:

  1. تكلفة النقل: الوقت المستغرق لإرسال السؤال عبر الإنترنت إلى الخادم.
  2. تكلفة التحميل: الوقت المستغرق لنقل الخبير من قرص صلب بطيء (CPU) إلى بنك ذاكرة سريع (GPU) إذا لم يكن موجوداً هناك بالفعل.
  3. الحوسبة والانتظار: مدى سرعة الخادم في التفكير، ومدة انتظار السؤال في الطابور خلف الأسئلة الأخرى.
  4. عقوبة الجودة: إذا استخدم الخادم نسخة "مضغوطة" من الخبير لتوفير المساحة، فكيف ستتأثر جودة الإجابة؟

يعمل HetRoute في مرحلتين: مرحلة غير متزامنة (Offline) ومرحلة متزامنة (Online).

المرحلة غير المتزامنة (صانع الخرائط):
قبل طرح أي أسئلة، ينظر HetRoute إلى الشبكة ويقرر أين يضع نسخاً من الخبراء. الأمر لا يتعلق فقط بوضعهم في أقرب خادم. بل يسأل: "إذا وضعنا نسخة من هذا الخبير في الخادم (ب)، فهل سيوفر ذلك الوقت لاحقاً؟" كما يقرر أي الخبراء يجب أن يعيشوا في ذاكرة الـ "GPU" السريعة وأيها يمكن أن يبقى في ذاكرة الـ "CPU" البطيئة. والأهم من ذلك، أنه ينشئ نسخاً "فائضة". تماماً مثل وجود إطار احتياطي في سيارتك، يضع HetRoute نسخاً إضافية من الخبراء الأكثر شيوعاً في خوادم مختلفة. هذا يضمن أنه إذا كان أحد الخوادم مشغولاً أو معطلاً، فسيكون لدى قائد الفريق خيارات أخرى.

المرحلة المتزامنة (الملاح في الوقت الفعلي):
عند وصول سؤال حقيقي، لا يختار HetRoute أقرب خادم فحسب. بل ينظر إلى مجموعة الخبراء المطلوبة لهذا السؤال بالكامل. يسأل: "إذا أرسلنا الخبير (أ) إلى الخادم (س) والخبير (ب) إلى الخادم (ص)، فما هو الوقت الإجمالي؟" إنه يحسب "عنق الزجاجة" — الجزء الأبطأ في الفريق. إذا كان الخادم (س) سريعاً ولكن الخادم (ص) عالق في ازدحام مروري، فقد يقرر HetRoute إرسال كلا الخبيرين إلى الخادم (ع)، حتى لو كان الخادم (ع) أبعد قليلاً، لأن الفريق بأكمله سينتهي بشكل أسرع معاً.

إنه يستخدم خدعة ذكية تسمى "البحث الشعاعي" (beam search) (مثل كشاف ضوئي يمسح عدة مسارات أفضل في وقت واحد) للعثور على المزيج المثالي من الخوادم دون العلوق في متاهة من الاحتمالات.

النتائج: أسرع، أذكى، وأكثر أماناً

اختبر المؤلفون نظام HetRoute على شبكة محاكاة مكونة من 10 خوادم حافة ذات سرعات واتصالات متفاوتة. واستخدموا ثلاثة نماذج ذكاء اصطناعي مختلفة لمعرفة كيفية أدائه.

كانت النتائج مبهرة:

  • السرعة: قلل HetRoute متوسط الوقت اللازم للحصول على إجابة بنسبة 59.0% مقارنة بأفضل الأساليب الحالية. كما قلل أيضاً من "تأخر الذيل" (أسوأ حالات التأخير التي تحدث عندما تسوء الأمور) بنسبة 58.0%.
  • حركة المرور: قلل من كمية البيانات المنتقلة بين الخوادم بنسبة 72.1%. وهذا أمر ضخم لأن إرسال البيانات عبر الإنترنت بطيء ومكلف.
  • الإنتاجية: استطاع النظام التعامل مع 2.13 ضعف عدد الأسئلة في الثانية الواحدة مقارنة بالطرق الأخرى.
  • الجودة: رغم كونه أسرع، ظلت جودة الإجابات عالية جداً. فقد تم الحفاظ على "تدهور الجودة" (مدى سوء الإجابة) ضمن ميزانية ضئيلة ومحددة مسبقاً بنسبة 2%.

كما أثبت البحث رياضياً أن نظامهم "آمن من حيث الجودة". حتى لو أصبحت الشبكة مزدحمة للغاية وتم إغلاق المسارات السريعة العادية، فإن Het-Route لديه خطة "احتياطية". سيوجه السؤال دائماً إلى خبير "كامل الدقة" (النسخة الأعلى جودة) والذي يضمن وجوده في مكان ما، مما يضمن أن الإجابة لن تكون سيئة أبداً، حتى لو استغرقت وقتاً أطول قليلاً.

لماذا يهم هذا؟

يوضح هذا البحث أننا لسنا مضطرين للاختيار بين السرعة والجودة، أو بين الحوسبة المحلية والبعيدة. من خلال معاملة خبراء الذكاء الاصطناعي كفريق منسق بدلاً من عدائين فرديين، ومن خلال التخطيط للمسار بالكامل بناءً على حركة المرور في الوقت الفعلي وصحة الحاسوب، يمكننا جعل الذكاء الاصطناعي القوي يعمل بسلاسة حتى على "حافة" الشبكة (مثل هاتفك أو خادم محلي). يشير HetRoute إلى أن مستقبل الذكاء الاصطناعي لا يتعلق فقط ببناء نماذج أكبر، بل بكوننا أكثر ذكاءً في كيفية نقلها وتوزيعها. إنه يحول شبكة فوضوية ومزدحمة إلى آلة تعمل بدقة متناهية، حيث يعرف كل خبير بالضبط أين يذهب لإنجاز المهمة بأسرع وقت ممكن.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →