← أحدث الأبحاث
🤖 AI

SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters

تُعد SAGA مجدولاً موزعاً يعمل على تحسين كفاءة سير عمل وكلاء الذكاء الاصطناعي المركبة على مجموعات وحدات معالجة الرسومات من خلال الانتقال من الجدولة على مستوى الطلب إلى الجدولة على مستوى البرنامج، مما يحافظ على حالات ذاكرة التخزين المؤقت لمفاتيح القيم (KV cache) الوسيطة ويقلل وقت إكمال المهام بمقدار 1.64 ضعفاً رغم المقايضة في ذروة الإنتاجية.

المؤلفون الأصليون: Dongxin Guo, Jikun Wu, Siu Ming Yiu

نُشر 2026-05-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Dongxin Guo, Jikun Wu, Siu Ming Yiu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مطبخاً مزدحماً (عنقود معالجة رسومية - GPU cluster) حيث يحاول الطهاة (وكلاء الذكاء الاصطناعي - AI agents) طهي وجبات معقدة متعددة الأصناف (مهام الذكاء الاصطناي).

حالياً، يعامل معظم مديري المطابخ (المجدولين الحاليين مثل vLLM) كل طلب كأنه حدث منفصل ومنفرد. إذا احتاج الطاهي إلى تقطيع الخضروات، ثم الانتظار حتى يسخن الفرن، ثم تقطيع المزيد من الخضروات، فإن المدير يجبره على:

  1. طهي الدفعة الأولى.
  2. التخلص من الخضروات المقطعة والسكاكين المتسخة (ذاكرة التخزين المؤقت KV cache) لأن الطاهي في حالة "انتظار".
  3. عندما يصبح الفرن جاهزاً، يضطر الطاهي لتقطيع نفس الخضروات تماماً من البداية مرة أخرى.

دورة "البدء من جديد" هذه تتكرر عشرات المرات لكل وجبة، مما يهدر كميات هائلة من الوقت والمساحة، ويجعل المطابخ أبطأ بمقدار 3 إلى 8 مرات مما ينبغي أن تكون عليه.

SAGA هو مدير مطبخ جديد يغير القواعد. فبدلاً من النظر إلى الطلبات الفردية، ينظر SAGA إلى الوصفة بأكملها كوحدة واحدة. إليك كيف يعمل، باستخدام تشبيهات بسيطة:

1. "كتاب الوصفات" (رسوم تنفيذ الوكيل - Agent Execution Graphs)

بدلاً من التخمين لما سيفعله الطاهي لاحقاً، يقرأ SAGA كتاب الوصفات (Agent Execution Graph).

  • المشكلة: يتوقف الطاهي لانتظار الفرن (استدعاء أداة - tool call). يفترض المديرون القدامى أن الطاهي قد انتهى ويقومون بتنظيف الطاولة.
  • حل SAGA: يعرف SAGA أن الوصفة تقول: "بعد نضوج الفرن، سنحتاج لتقطيع البصل مجدداً". لذا، يخبر SAGA الطاهي: "احتفظ بالبصل المقطع والسكين على الطاولة. لا تغسلهم بعد".
  • النتيجة: عندما ينتهي وقت الفرن، يكمل الطاهي من حيث توقف تماماً. لا إعادة تقطيع. SAGA يتوقع هذا بدقة تجعله يعمل بكفاءة تقارب مديرًا يستطيع رؤية المستقبل (مدير "مثالي" نظرياً).

2. استراتيجية "طاولة كبار الشخصيات" (التجميع المرتبط بالجلسة - Session-Affinity Batching)

تخيل أن هناك طاهياً يعمل على وجبة معقدة مكونة من 10 أصناف.

  • المشكلة: في النظام القديم، إذا انشغل الطاهي، فقد يرسل المدير الخطوة التالية من الوجبة إلى طاهٍ آخر في محطة عمل أخرى. يضطر الطاهي الجديد لإعادة قراءة الوصفة كاملة وإعادة تقطيع الخضروات لأنه لا يملك ملاحظات الطاهي الأول.
  • حل SAGA: يقول SAGA: "هذه الوجبة المكونة من 10 أصناف تنتمي بالكامل إلى الطاهي أ في المحطة 1". حتى لو كان الطاهي (أ) ينتظر الفرن، يتم حجز الخطوة التالية له. إذا أصبحت المحطة 1 مزدحمة جداً، فقد ينقل SAGA الوجبة بأكملها إلى محطة جديدة، لكنه يجلب معه "الملاحظات" (ذاكرة التخزين المؤقت) حتى لا يبدأ الطاهي الجديد من الصفر.
  • النتيجة: يظل المطبخ منظماً، ولا يضيع الطهاة وقتهم في إعادة العمل.

3. قاعدة "العدالة" (الحصة العادلة للوكيل - Agent Fair Share)

تخيل مطعماً به نوعان من الزبائن:

  • الزبون (أ): يطلب برجر بسيطاً (مهمة قصيرة).
  • الزبون (ب): يطلب مأدبة ضخمة مكونة من 50 صنفاً (مهمة وكيل طويلة ومعقدة).
  • المشكلة: غالباً ما يعطي المديرون القدامى الأولوية للبرجر لأنه سريع الانتهاء. فينتظر زبون المأدبة للأبد، ويشعر بالإحباط.
  • حل SAGA: ينظر SAGA إلى المأدبة بأكملها. يدرك أنه: "إذا استمررنا في تقديم البرجر، فلن تنتهي المأدبة أبداً". لذا يضمن حصول المأدبة على قدر كافٍ من الاهتمام لتنتهي في الوقت المحدد، حتى لو كان ذلك يعني انتظار زبون البرجر لفترة أطول قليلاً. إنه يضمن حصول الجميع على وجباتهم الكاملة، وليس فقط الوجبات الخفيفة السريعة.

المقايضة (توازن "السرعة مقابل الجودة")

SAGA سريع للغاية في إنهاء المهام الفردية المعقدة (تقليل وقت إنهاء المهمة بمقدار 1.64 مرة). ومع ذلك، ولأنه يقضي وقتاً في التنظيم والإبقاء على الأشياء جاهزة للخطوة التالية، فإنه لا يستطيع إنتاج عدد إجمالي أكبر من الوجبات في الساعة مقارنة بمدير يرمي بكل شيء في الخلاط ويتجاهل الوصفة.

  • ادعاء الورقة البحثية: SAGA أبطأ بنسبة 30% تقريباً في حجم الإنتاج الخام الأقصى (throughput) مقارنة بأسلوب "الفرم والرمي".
  • لماذا هذا مهم: تجادل الورقة بأن هذه مقايضة جيدة. معظم وكلاء الذكاء الاصطناعي تفاعليون (مثل مساعد البرمجة أو بوت المتصفح) حيث يهتم المستخدمون بـ سرعة انتهاء المهمة، وليس بعدد المهام التي يمكن للخادم استيعابها نظرياً.

ملخص النتالئج

عند اختباره على حاسوب فائق حقيقي مكون من 64 وحدة معالجة رسومية (GPU):

  • السرعة: تنتهي المهام أسرع بـ 1.64 مرة من المعيار الأفضل حالياً (vLLM مع ذاكرة التخزين المؤقت للبادئة).
  • الذاكرة: استخدم المطبخ مساحة الطاولة (ذاكرة الـ GPU) بكفاءة أعلى بنسبة 22%، مما يعني قدرته على التعامل مع وصفات أكثر تعقيداً دون نفاد المساحة.
  • الموثوقية: انتهت 99.2% من المهام ضمن حدود الوقت الموعودة، حتى عندما كان المطبخ فوضوياً ومزدحماً.

باختيد، يمنع SAGA وكلاء الذكاء الاصطناعي من التخلص من عملهم في كل مرة يتوقفون فيها، مما يضمن قدرتهم على استئناف العمل من حيث توقفوا تماماً، مما يجعل مهام الذكاء الاصطناعي المعقدة تبدو أكثر سرعة واستجابة وموثوقية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →