SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters
تُعد SAGA مجدولاً موزعاً يعمل على تحسين كفاءة سير عمل وكلاء الذكاء الاصطناعي المركبة على مجموعات وحدات معالجة الرسومات من خلال الانتقال من الجدولة على مستوى الطلب إلى الجدولة على مستوى البرنامج، مما يحافظ على حالات ذاكرة التخزين المؤقت لمفاتيح القيم (KV cache) الوسيطة ويقلل وقت إكمال المهام بمقدار 1.64 ضعفاً رغم المقايضة في ذروة الإنتاجية.