← أحدث الأبحاث
🤖 machine learning

Theoretically Optimal Attention/FFN Ratios in Disaggregated LLM Serving

تقدم هذه الورقة إطاراً تحليلياً وقاعدة تخصيص ذات صيغة مغلقة لتحديد النسبة المثلى نظرياً لموارد الانتباه (Attention) مقابل طبقات التغذية الأمامية (FFN) في خدمة النماذج اللغوية الكبيرة (LLM) المفككة، مع مراعاة ديناميكيات عبء العمل العشوائية وأعباء التزامن الإضافية لتقليل وقت خمول الأجهزة وحظر مستوى الخطوة.

المؤلفون الأصليون: Chendong Song, Meixuan Wang, Hang Zhou, Hong Liang, Yuan Lyu, Zixi Chen, Yuwei Fan, Zijie Zhou

نُشر 2026-05-08
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chendong Song, Meixuan Wang, Hang Zhou, Hong Liang, Yuan Lyu, Zixi Chen, Yuwei Fan, Zijie Zhou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مصنعاً ضخماً فائق السرعة ينتج "أفكاراً" (رموزاً/tokens) لعقل ذكاء اصطناعي عملاق. هذا المصنع لديه خطا تجميع رئيسيان يعملان معاً لإتمام كل فكرة:

  1. خط الذاكرة (الانتباه - Attention): هذا الفريق يشبه أمين المكتبة. عليهم الركض ذهاباً وإياباً إلى رفوف كتب ضخمة ومتنامية (ذاكرة الـ KV cache) للعثور على صفحات محددة لكل طلب. ومع ازدياد حجم رفوف الكتب، يصبح هذا الفريق أبطأ وأبطأ لأنهم يحملون أحمالاً أثقل. إنهم مقيدون بالذاكرة (memory-bound).

  2. خط الحساب (الشبكة العصبية الأمامية - FFN): هذا الفريق يشبه آلة حاسبة فائقة السرعة. هم لا يحتاجون للنظر في رفوف الكتب؛ بل يقومون فقط بمعالجة الأرقام بناءً على ما يسلمه لهم أمناء المكتبة. إنهم مقيدون بالحوسبة (compute-bound) ويمكنهم العمل بسرعة هائلة إذا توفر لديهم عمل كافٍ للقيام به.

المشكلة: "الرقصة غير المتوافقة"

في الأيام الخوالي، كان هذان الفريقان عالقين في نفس الغرفة. إذا كان أمناء المكتبة بطيئين، كان على الآلات الحاسبة الجلوس في حالة خمول انتظاراً لهم. وإذا كانت الآلات الحاسبة سريعة، كان أمناء المكتبة هم حجر العثرة.

لحل هذه المشكلة، ابتكر المهندسون تخطيطاً جديداً يسمى AFD (تجزئة الانتباه والشبكة العصبية الأمامية). لقد نقلوا أمناء المكتبة والآلات الحاسبة إلى غرف منفصلة. الآن، يمكنك امتلاك العديد من فرق أمناء المكتبة لتغذية غرفة حاسبة واحدة ضخمة.

لكن هنا تكمن العقبة: كم عدد فرق أمناء المكتبة التي تحتاجها لغرفة حاسبة واحدة؟

  • أمناء مكتبة قليلون جداً؟ ستجلس الآلة الحاسبة خاملة، جائعة للبيانات.
  • أمناء مكتبة كثيرون جداً؟ ستصبح الآلة الحاسبة مثقلة، وسيتعين على أمناء المكتبة الوقوف بانتظار اللحاق بالآلة الحاسبة.

إن إيجاد النسبة المثالية (والتي سنسميها r) يشبه محاولة إيجاح العدد المثالي من النادلين لطاهٍ واحد. إذا أخطأت في التقدير، فسيتباطأ المصنع بأكمله.

حل الورقة البحثية: "كرة بلورية" لمديري المصانع

أدرك مؤلفو هذه الورقة أن التخمين في تحديد النسبة أمر صعب لأن العمل عشوائي.

  • بعض العملاء لديهم أسئلة قصيرة؛ وآخرون لد لديهم قصص طويلة.
  • بعض الطلبات تنتهي بسرعة؛ بينما يستغرق البعض الآخر وقتاً طويلاً.
  • "رفوف الكتب" (الذاكرة) تنمو بشكل مختلف لكل طلب.

بسبب هذه العشوائية، لا يمكنك مجرد استخدام معادلة رياضية بسيطة تعتمد على المتوسطات. أنت بحاجة إلى طريقة للتنبؤ بالفوضى.

"الخلطة السرية" الخاصة بهم هي إطار عمل رياضي جديد يقوم بثلاثة أشياء:

  1. يقيس "متوسط الفوضى": طوروا طريقة للنظر في سجلات الطلبات السابقة (traces) وحساب رقم واحد (يسمى θ) يمثل عبء العمل الحقيقي، مع مراعاة حقيقة أن الطلبات الأطول هي الأكثر عرضة للظهور في أي لحظة عشوائية.
  2. يأخذ في الاعسبار "العداء الأبطأ": في هذا المصنع، يجب على جميع فرق أمناء المكتبة إنهاء عملهم قبل أن تبدأ الآلة الحاسبة. إذا علق فريق واحد مع كتاب ضخم، فإن الخط بأكمله ينتظر. وضع المؤلفون صيغة للتنبؤ بمقدار الوقت الإضافي الضائع بسبب هؤلاء "المتلكئين" (أبطأ العمال).
  3. يعطي وصفة "النسبة الذهبية": باستخدام هذين الاستبصارين، استنتجوا قاعدة بسيطة ذات صيغة مغلقة. أدخل مواصفات الأجهزة الخاصة بك وسجلات الطلبات، وستخبرك الصيغة بالعدد الدقيق لفرق أمناء المكتبة التي تحتاجها لغرفة الحاسبة الخاصة بك لتعمل بأقصى سرعة.

النتائج: "إنه يعمل!"

بنى الفريق محاكياً رقمياً (مصنعاً افتراضياً) لاختبار نظريتهم.

  • جربوا أعداداً مختلفة من فرق أمناء المكتبة (من 1 إلى 32).
  • قارنوا توقع "النسبة الذهبية" الخاصة بهم مقابل أفضل أداء فعلي وجده المحاكي.
  • الحكم: كان توقعهم دقيقاً للغاية، حيث طابق المحاكاة الواقعية بنسبة ضمن 10%.

وجدوا أيضاً أنه مع إضافة المزيد من فرق أمناء المكتبة، فإن "وقت الانتظار" الناتج عن أبطأ فريق يزداد، لكن صيغتهم تأخذ هذا في الاعتبار، مما يضمن عدم إضافة الكثير من الفرق وإهدار المال.

الخلاصة

توفر هذه الورقة البحثية كتاب قواعد علمي لبناء مصانع الذكاء الاصطناعي المنقسمة هذه. بدلاً من التخمين أو التجربة والخطأ، يمكن لمصممي الأنظمة استخدام هذه الرياضيات لتحديد كيفية موازنة موارد الذاكرة والحوسبة بدقة، مما يضمن تشغيل الذكاء الاصطناعي بأسرع وأكثر كفاءة ممكنة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →