SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters
SAGA एक वितरित शेड्यूलर है जो रिक्वेस्ट-लेवल से प्रोग्राम-लेवल शेड्यूलिंग पर स्विच करके GPU क्लस्टर्स पर कंपाउंड AI एजेंट वर्कफ़्लो की दक्षता में सुधार करता है, जो इंटरमीडिएट KV कैश स्टेट्स को सुरक्षित रखता है और पीक थ्रूपुट में ट्रेड-ऑफ के बावजूद टास्क कंप्लीशन टाइम को 1.64x कम करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त रसोई (एक GPU क्लस्टर) चला रहे हैं जहाँ शेफ (AI एजेंट) जटिल, बहु-कोर्स भोजन (AI कार्य) बनाने की कोशिश कर रहे हैं।
वर्तमान में, अधिकांश किचन मैनेजर (मौजूदा शेड्यूलर जैसे vLLM) हर एक ऑर्डर को एक पूरी तरह से अलग, एक बार की घटना के रूप में देखते हैं। यदि किसी शेफ को सब्जियाँ काटनी पड़ती हैं, फिर ओवन गरम होने का इंतज़ार करना पड़ता है, फिर से सब्जियाँ काटनी पड़ती हैं, तो मैनेजर शेफ को मजबूर करता है:
- पहले बैच को पकाना।
- कटी हुई सब्जियों और गंदे चाकूओं (KV कैश) को फेंक देना क्योंकि शेफ "इंतज़ार" कर रहा है।
- जब ओवन तैयार हो जाता है, तो शेफ को वही सब्जियाँ फिर से शुरू से काटनी पड़ती हैं।
यह "शुरू से शुरू करने" वाला चक्र एक भोजन के लिए दर्जनों बार होता है। यह बहुत अधिक समय और स्थान बर्बाद करता है, जिससे रसोई जितनी तेज़ होनी चाहिए उससे 3 से 8 गुना धीमी हो जाती है।
SAGA एक नया किचन मैनेजर है जो नियम बदल देता है। व्यक्तिगत ऑर्डरों को देखने के बजाय, SAGA पूरी रेसिपी को एक एकल इकाई के रूप में देखता है। यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:
1. "रेसिपी बुक" (एजेंट निष्पादन ग्राफ - Agent Execution Graphs)
अगले कदम का अनुमान लगाने के बजाय, SAGA रेसिपी बुक (एजेंट निष्पादन ग्राफ) को पढ़ता है।
- समस्या: शेफ ओवन का इंतज़ार करने के लिए रुक जाता है (एक "टूल कॉल")। पुराने मैनेजर मान लेते हैं कि शेफ का काम खत्म हो गया है और काउंटर साफ कर देते हैं।
- SAGA का समाधान: SAGA जानता है कि रेसिपी कहती है, "ओवन के बाद, हमें फिर से प्याज काटने की आवश्यकता है।" इसलिए, वह शेफ को बताता है: "कटी हुई प्याज और चाकू को काउंटर पर ही रहने दो। उन्हें अभी मत धोओ।"
- परिणाम: जब ओवन तैयार हो जाता है, तो शेफ वहीं से शुरू करता है जहाँ उसने छोड़ा था। दोबारा काटने की कोई ज़रूरत नहीं। SAGA इसका इतना सटीक अनुमान लगाता है कि यह लगभग उतना ही प्रदर्शन करता है जितना कि एक ऐसा मैनेजर जो भविष्य देख सकता है (एक सैद्धांतिक "इष्टतम" मैनेजर)।
2. "वीआईपी टेबल" रणनीति (सेशन-अफ़िनिटी बैचिंग - Session-Affinity Batching)
कल्पना कीजिए कि एक शेफ एक जटिल 10-कोर्स भोजन पर काम कर रहा है।
- समस्या: पुराने सिस्टम में, यदि शेफ व्यस्त हो जाता है, तो मैनेजर अगले चरण को किसी दूसरे शेफ को एक अलग स्टेशन पर भेज सकता है। नए शेफ को पूरी रेसिपी फिर से पढ़नी पड़ती है और सब्जियाँ फिर से काटनी पड़ती हैं क्योंकि उसके पास पहले शेफ के नोट्स नहीं होते।
- SAGA का समाधान: SAGA कहता है, "यह पूरा 10-कोर्स भोजन शेफ A और स्टेशन 1 के लिए है।" भले ही शेफ ओवन का इंतज़ार कर रहा हो, अगला चरण उनके लिए आरक्षित है। यदि स्टेशन 1 बहुत अधिक भीड़भाड़ वाला हो जाता है, तो SAGA पूरे भोजन को एक नए स्टेशन पर ले जा सकता है, लेकिन वह अपने साथ "नोट्स" (कैश) भी लाता है ताकि नया शेफ शुरू से शुरू न करे।
- परिणाम: रसोई व्यवस्थित रहती है, और शेफ काम को दोबारा करने में समय बर्बाद नहीं करते हैं।
3. "निष्पक्षता" का नियम (एजेंट फेयर शेयर - Agent Fair Share)
कल्पना कीजिए कि एक रेस्टोरेंट में दो प्रकार के ग्राहक हैं:
- ग्राहक A: एक साधारण बर्गर का ऑर्डर देता है (एक छोटा कार्य)।
- ग्राहक B: एक विशाल, 50-कोर्स दावत का ऑर्डर देता है (एक लंबा, जटिल एजेंट कार्य)।
- समस्या: पुराने मैनेजर अक्सर बर्गर को प्राथमिकता देते हैं क्योंकि यह जल्दी खत्म हो जाता है। दावत वाला ग्राहक अनंत काल तक इंतज़ार करता रहता है, जिससे वह निराश हो जाता है।
- SAGA का समाधान: SAGA पूरे दावत को देखता है। वह महसूस करता है, "यदि हम केवल बर्गर खिलाते रहेंगे, तो दावत कभी पूरी नहीं होगी।" वह सुनिश्चित करता है कि दावत को समय पर पूरा करने के लिए पर्याप्त ध्यान मिले, भले ही इसका मतलब यह हो कि बर्गर को थोड़ा इंतज़ार करना पड़े। यह गारंटी देता है कि हर किसी को उनका पूरा भोजन मिले, न कि केवल त्वरित स्नैक्स।
ट्रेड-ऑफ (द "स्पीड बनाम क्वालिटी" संतुलन)
SAGA व्यक्तिगत जटिल भोजन को पूरा करने में अविश्वसनीय रूप से तेज़ है (कार्य को पूरा करने के समय को 1.64 गुना कम कर देता है)। हालाँकि, क्योंकि यह व्यवस्थित करने और अगले चरण के लिए चीज़ों को तैयार रखने में समय बिताता है, यह उस मैनेजर की तरह कुल भोजन की संख्या नहीं निकाल सकता जो बस सब कुछ ब्लेंडर में डाल देता है और रेसिपी की अनदेखी करता है।
- पेपर का दावा: अधिकतम कच्चे वॉल्यूम (थ्रूपुट) के मामले में SAGA "चर्न-एंड-बर्न" शैली की तुलना में 30% धीमा है।
- यह क्यों मायने रखता है: पेपर का तर्क है कि यह एक अच्छा ट्रेड-ऑफ है। अधिकांश AI एजेंट इंटरैक्टिव होते हैं (जैसे कोडिंग असिस्टेंट या ब्राउज़र बॉट) जहाँ उपयोगकर्ता यह देखते हैं कि कार्य कितनी जल्दी समाप्त होता है, न कि सर्वर सैद्धांतिक रूप से प्रति घंटे कितने कार्य निपटा सकता है।
परिणामों का सारांश
एक वास्तविक 64-GPU सुपरकंप्यूटर पर परीक्षण किए जाने पर:
- गति: कार्य वर्तमान सर्वोत्तम मानक (प्रेडिक्स कैशिंग के साथ vLLM) की तुलना में 1.64 गुना तेज़ी से पूरे हुए।
- मेमोरी: रसोई ने अपने काउंटर स्पेस (GPU मेमोरी) का 22% अधिक कुशलता से उपयोग किया, जिसका अर्थ है कि वह बिना जगह खत्म हुए अधिक जटिल रेसिपी संभाल सकती थी।
- विश्वसनीयता: 99.2% कार्य अपने वादा किए गए समय के भीतर पूरे हुए, भले ही रसोई अराजक और भीड़भाड़ वाली थी।
संक्षेप में, SAGA AI एजेंटों को हर बार रुकने पर अपना काम फेंकने से रोकता है, यह सुनिश्चित करता है कि वे ठीक वहीं से शुरू कर सकें जहाँ उन्होंने छोड़ा था, जिससे जटिल AI कार्य बहुत अधिक तेज़ और विश्वसनीय महसूस होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।