← أحدث الأبحاث
📊 statistics

Throughput-Optimal Scheduling Algorithms for LLM Inference and AI Agents

تؤسس هذه الورقة لأسس نظرية الطوابير الرياضية لاستنتاج النماذج اللغوية الكبيرة، حيث تثبت أن خوارزميات الجدولة المحافظة على العمل تحقق أقصى قدر من الإنتاجية لكل من أعباء عمل النماذج الفردية وأعباء عمل الوكلاء الذكيين، مع تقييم الأنظمة الواقعية لتأكيد مثالية نظامي Orca وSarathi-Serve والتحذير من عدم استقرار FasterTransformer وvLLM التقليدي.

المؤلفون الأصليون: J. G. Dai, Tianze Deng, Yueying Li, Tianyi Peng

نُشر 2026-05-19
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: J. G. Dai, Tianze Deng, Yueying Li, Tianyi Peng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مصنعاً فائق السرعة لبناء روبوتات مخصصة. في هذا المصنع، تمر كل طلبية (كل "طلب") بمرحلتين متميزتين:

  1. مرحلة الإعداد (التحضير المسبق - Prefill): أنت تقرأ المخططات وتجمع كل القطع اللازمة. هذه مهمة شاقة تتطلب الكثير من القوة الذهنية (الحوسبة) ولكنها تحدث دفعة واحدة.
  2. مرحلة التجميع (فك التشفير - Decode): تبدأ في بناء الروبوت، بإضافة قطعة واحدة تلو الأخرى، واحدة تلو الأخرى. هذه مهمة أبطأ وتعتمد بشكل كبير على الذاكرة، وتحدث خطوة بخطوة.

يمتلك مصنعك ذراعاً روبوتية ضخمة وسريعة جداً (وحدة معالجة الرسومات - GPU)، يمكنها العمل على طلبات متعددة في وقت واحد. ومع ذلك، فإن للذراع حداً معيناً لإجمالي الوزن الذي يمكنها حمله في قبضتها في المرة الواحدة (ميزانية الرموز - Token Budget).

الورقة البحثية التي قدمتها هي دراسة رياضية حول كيفية تنظيم الطلبات بحيث لا يتوقف مصنعك عن العمل أبداً، وينتج أكبر عدد ممكن من الروبوتات دون أن ينسد المسار.

إليك تفصيل نتائجهم باستخدام تشبيهات بسيطة:

1. القاعدة الذهبية: "لا تترك الذراع خاملة"

الاكتشاف الأكثر أهمة في هذه الورقة هو مفهوم "الحفاظ على العمل" (Work-Conserving).

تخيل أن ذراع الروبوت الخاصة بك مستعدة للإمساك بالقطع.

  • الطريقة السيئة: لا تسمح للذراع بالإمساك بقطع "الإعداد" إلا إذا كانت هناك طلبات "إعداد" فقط تنتظر. إذا كانت هناك طلبات "تجميع" تنتظر، فإنك تتجاهلها، حتى لو كان هناك مساحة فارغة في الذراع. أو أنك لا تسمح لها بالإمساك بقطع "التجميع" إلا إذا كانت هناك طلبات "تجميع" فقط.
    • النتيجة: تجلس الذراع نصف فارغة، منتظرة نوعاً معيناً من الطلبات، بينما تتراكم كمية هائلة من النوع الآخر من الطلبات. يتباطأ المصنع أو يتعطل.
  • الطريقة الجيدة (الحفاظ على العمل): إذا كان لدى الذراع مساحة، فقم بملئها بأي شيء متاح. اخلط قطع الإعداد وقطع التجميع في نفس الدفعة. لا تترك الذراع خاملة أبداً إذا كان هناك عمل للقيام به.

ادعاء الورقة البحثية: الخوارزميات التي تتبع قاعدة "ملء الدلو" هذه (مثل Orca و Sarathi-Serve) مثبتة رياضياً بأنها الأكثر كفاءة. يمكنها التعامل مع أقصى قدر ممكن من العمل دون أن ينهار النظام.

2. "مديرو المصنع" القدامى مقابل الجدد

اختبر المؤلفون أربعة "مديرين" (خوارزميات جدولة) مشهورين لمعرفة من منهم يتبع القاعدة الذهبية:

  • FasterTransformer و Vanilla vLLM (المديرون الصارمون): هؤلاء المديرون متطلبون للغاية.
    • FasterTransformer لا يلتقط إلا قطع التجميع. إذا لم تكن هناك طلبات تجميع، فإنه يتجاهل طلبات الإعداد المنتظرة في الطابور، حتى لو كانت الذراع فارغة.
    • Vanilla vLLM لا يلتقط إلا قطع الإعداد. إذا لم تكن هناك طلبات إعداد، فإنه يتجاهل طلبات التجميع.
    • الحكم: هؤلاء ليسوا مثاليين. تحت الحمل الثقيل، يتسببون في انسداد المصنع وعدم استقراره.
  • Orca و Sarathi-Serve (المديرون المرنون): هؤلاء يخلطون بين نوعي العمل. يملؤون الذراع بما يتناسب معها.
    • الحكم: هؤلاء مثاليون. يحافظون على تشغيل المصنع بسلاسة وبأقصى سرعة.

3. مصنع "الوكلاء الذكيين" (سير العمل المعقد)

أحياناً، لا يكون الطلب الواحد مجرد روبوت واحد؛ بل فريق كامل من الروبوتات يعمل معاً.

  • الرسم البياني الموجه غير الدوري (DAG): تخيل سير عمل حيث يذهب الطلب (أ) إلى المحطة 1، ثم المحطة 2، ثم المحطة 3، ولا يعود أبداً.
    • النتيجة: طالما أن سير العمل عبارة عن خط مستقيم (بدون حلقات)، فإن قاعدة "لا تترك الذراع خاملة" تظل تعمل بشكل مثالي عبر جميع المحطات.
  • التفرع والدمج (Fork-Join): تخيل أن الطلب (أ) ينقسم إلى ثلاث مهام فرعية تذهب إلى ثلاث محطات مختلفة، ويجب أن تنتهي جميعها قبل أن تتم الخطوة النهائية.
    • النتيجة: قاعدة "لا تترك الذراع خاملة" تعمل هنا أيضاً بشكل ممتاز.
  • الدورة (الفخ): تخيل أن الطلب (أ) يذهب إلى المحطة 1، ثم المحطة 2، لكن الطلب (ب) يذهب من المحطة 2 عائداً إلى المحطة 1. إنهم يطاردون بعضهم البعض في دائرة.
    • النتيجة: هنا، قاعدة "لا تترك الذرح خاملة" يمكن أن تفشل. حتى لو كان المديرون يبذلون قصارى جهدهم، فإن حركة المرور الدائرية يمكن أن تسبب ازدحاماً مرورياً لا ينتهي. توضح الورقة أنه إذا كان مصنعك يحتوي على هذه الحلقات الدائرية، فأنت بحاجة إلى مدير أكثر ذكاءً وحذراً، وليس مجرد مدير "يملأ الدلو".

4. مفاجأة "حجم الدلو"

هناك حد ثانٍ في المصنع وهو: حجم الدفعة (Batch Size). هذا هو الحد الأقصى لـ عدد الطلبات التي يمكن للذراع حملها، بغض النظر عن وزنها.

  • المفاجأة: وجد المؤلفون أن ملء الذراع إلى أقصى حد لوزنها (ميزانية الرموز) هو في الواقع فكرة سيئة في بعض الأحيان.
  • التشبيه: تخيل أن لديك دلواً يتسع لـ 100 رطل. لديك 100 حصاة صغيرة (إعداد) و100 طوبة ثقيلة (تجميع).
    • إذا حاولت ملء الدلو بـ 100 رطل من الطوب، فقد لا تسع إلا 5 طوبات فقط. الوقت الذي يستغرقه رفع هذا الحمل الثقيل طويل.
    • ولكن إذا توقفت عند 50 رطلاً (حمل أصغر)، فقد تتمكن من رفعه بشكل أسرع، مما يسمح لك بالقيام برحلات أكثر في الساعة.
  • النتيجة: في مواقف معينة، تكون الاستراتيجية الأكثر كفاءة هي التوقف عن ملء الدلو قبل أن يمتلئ تماماً للحفاظ على سرعة المعالجة عالية. وهذا يعني أنه حتى "المديرين الجيدين" (الحفاظ على العمل) يمكن أن يفشلوا إذا كانت قواعد المصنع (حدود حجم الدفعة) صارمة جداً وكان مزيج الطلبات هو السبب في حدوث انسداد.

ملخص

تخبرنا الورقة البحثية ما يلي:

  1. اخلط عملك: لا تفصل بين مهام الإعداد والتجميع. اخلطها في نفس الدفعة للحفاظ على نشاط وحدة معالجة الرسومات (GPU).
  2. Orca و Sarathi-Serve هما الفائزان: يتبعان قاعدة "الخلط والملء"، مما يجعلهما الخيارين الأكثر استقراراً وكفاءة في معظم الحالات.
  3. احذر من الحلقات: إذا كانت الوكلاء الذكيون يرسلون المهام ذهاباً وإياباً بين الخوادم في دائرة، فإن قواعد "ملء الدلو" البسيطة قد لا تعمل؛ أنت بحاجة إلى تحكم مروري خاص.
  4. الامتلاء ليس دائماً الأفضل: في بعض الأحيان، ترك مساحة صغيرة فارغة في دفعتك هو أمر أذكى من ملئها حتى الحافة، اعتماداً على حجم المهام الفردية وكيفية تداخلها.

الهدف من كل هذا الرياضيات هو مساعدة المهندسين على بناء أنظمة ذكاء اصطناعي لا تنهار عندما يسأل ملايين الأشخاص في وقت واحد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →