← नवीनतम पेपर
🤖 machine learning

Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving

Cascade एक LLM सर्विंग सिस्टम है जो शेड्यूलिंग और KV-कैश मैनेजमेंट को संयुक्त रूप से अनुकूलित करने के लिए एक गतिशील, प्रति-अनुरोध (per-request) विलंबता बजट (latency budget) का लाभ उठाता है, जिससे पारंपरिक फर्स्ट-कम-फर्स्ट-सर्वेड दृष्टिकोणों की तुलना में SLO-संतुष्ट गुडथ्रूप (goodput) और निष्पक्षता में महत्वपूर्ण सुधार होता है और उल्लंघनों को कम किया जाता है।

मूल लेखक: Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair, Daniel Berger, Pantea Zardoshti, Rodrigo Fonseca, Esha Choukse

प्रकाशित 2026-08-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair, Daniel Berger, Pantea Zardoshti, Rodrigo Fonseca, Esha Choukse

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक हलचल भरे, हाई-स्पीड ट्रेन स्टेशन की कल्पना करें जहाँ हजारों यात्री एक ही समय में अलग-अलग ट्रेनों में सवार होने की कोशिश कर रहे हैं। कुछ यात्रियों के पास केवल एक छोटा सा बैकपैक है (एक छोटा, त्वरित प्रश्न), जबकि अन्य भारी, बड़े सूटकेस खींच रहे हैं जो वर्षों की यादों से भरे हुए हैं (एक लंबी, जटिल कहानी या गहन तर्क कार्य)। आर्टिफिशियल इंटेलिजेंस की दुनिया में, ये "ट्रेनें" लार्ज लैंग्वेज मॉडल्स (LLMs) हैं—वे सुपर-स्मार्ट कंप्यूटर जो चैटबॉट्स, कोडिंग असिस्टेंट और रीजनिंग एजेंटों को शक्ति प्रदान करते हैं। "यात्री" वे अनुरोध (requests) हैं जो हम उन्हें भेजते हैं।

इन सिस्टम्स के लिए यह महसूस करना कि वे तेज़ और सहायक हैं, उन्हें एक विशिष्ट समय सीमा के भीतर उत्तर देने का वादा करना होता है, जिसे सर्विस लेवल ऑब्जेक्टिव (SLO) के रूप में जाना जाता है। इसे एक टिकट की तरह समझें जिस पर लिखा है, "आपको 5 सेकंड के भीतर ट्रेन में सवार होकर रवाना होना ही होगा।" समस्या यह है कि स्टेशन प्रबंधकों ने एक बहुत पुराने नियम का उपयोग किया है: "पहले आओ, पहले पाओ।" इसका मतलब है कि यदि एक विशाल सूटकेस वाला यात्री पहले आता है, तो बाकी सभी को उसके पीछे इंतजार करना होगा, भले ही उसके पीछे वाले व्यक्ति के पास केवल एक छोटा बैकपैक हो और उसे एक पल में सेवा दी जा सकती थी। इससे एक बड़ा ट्रैफिक जाम लग जाता है। इसके अलावा, स्टेशन के पास यात्रियों के सामान के लिए सीमित मात्रा में हाई-स्पीड स्टोरेज (जैसे कि एक वीआईपी वेटिंग रूम) है। यदि सामान को एक धीमे, दूर स्थित गोदाम में रखा जाता है, तो उसे लाने में समय लगता है। यदि स्टेशन प्रबंधक को यह नहीं पता कि प्रत्येक यात्री के पास कितना समय बचा है जब तक कि उनकी ट्रेन निकल न जाए, तो वे उस व्यक्ति के लिए सामान लाने में कीमती सेकंड बर्बाद कर सकते हैं जो पहले से ही लेट हो चुका है, जबकि कोई और व्यक्ति जो समय पर है, पीछे छूट सकता है।

यही वह चुनौती है जिसे CASCADE नामक एक नए सिस्टम द्वारा हल किया गया है, जिसका वर्णन यूनिवर्सिटी ऑफ ब्रिटिश कोलंबिया, माइक्रोसॉफ्ट अज़्योर रिसर्च और एनवीडिया (NVIDIA) के शोधकर्ताओं द्वारा एक हालिया पेपर में किया गया है। शोधकर्ताओं ने महसूस किया कि प्रत्येक अनुरोध का एक छिपा हुआ "टाइम बजट" होता है—वह समय जो उसे अपना काम पूरा करने की आवश्यकता है और वह समय जो उसे लेने की अनुमति है, उसके बीच का अंतर। कुछ अनुरोधों के पास एक बड़ा बजट (बहुत अतिरिक्त समय) होता है, जबकि अन्य के पास लगभग कुछ भी नहीं होता। पेपर तर्क देता है कि केवल इस बात को देखने के बजाय कि कौन पहले आया या अनुरोध कितना बड़ा है, सिस्टम को यह तय करने के लिए इस शेष समय बजट को देखना चाहिए कि आगे कौन जाएगा और उनके डेटा को कैसे प्रबंधित किया जाएगा।

CASCADE का मूल विचार यह है कि इस टाइम बजट को दो अलग-अलग कार्यों के लिए एक साझा मुद्रा (currency) के रूप में माना जाए: अनुरोधों के क्रम को तय करना और यह प्रबंधित करना कि उनका डेटा कहाँ रहता है। पेपर के सिमुलेशन में, जिन्होंने प्रोडक्शन सर्वर से वास्तविक दुनिया के ट्रैफिक डेटा का उपयोग किया और तीन अलग-अलग विशाल एआई मॉडल्स (Qwen-2.5-72B, Llama-3-70B, और Llama-3-405B) पर परीक्षण किया, CASCADE ने प्रभावशाली परिणाम दिखाए। प्रत्येक अनुरोध के पास कितना "टाइम हेडरूम" (समय की गुंजाइश) बचा है, इसकी लगातार गणना करके, CASCADE ने उन अनुरोधों को प्राथमिकता दी जिनके पास समय खत्म हो रहा था, जबकि पर्याप्त समय वाले अनुरोधों को थोड़ा इंतज़ार करने या अपने डेटा को धीमे, सस्ते स्टोरेज से प्राप्त करने दिया।

निष्कर्ष बताते हैं कि यह दृष्टिकोण दक्षता के लिए एक गेम-चेंजर है। उनके परीक्षणों में, CASCADE ने सफल अनुरोधों की संख्या (जिसे गुडपुट कहा जाता है) में vLLM जैसे लोकप्रिय सिस्टमों द्वारा उपयोग किए जाने वाले मानक "पहले आओ, पहले पाओ" तरीके की तुलना में 2.4 गुना तक सुधार किया। इससे भी महत्वपूर्ण बात यह है कि इसने उन अनुरोधों की संख्या को 40% कम कर दिया जिन्होंने अपनी समय सीमा मिस कर दी थी (SLO उल्लंघन)। शायद सबसे रचनात्मक रूप से, इसने यह सब लंबे, जटिल अनुरोधों को नुकसान पहुँचाए बिना किया। अन्य तरीकों के विपरीत, जो शायद छोटे अनुरोधों को जल्दी निपटाते हैं और लंबे अनुरोधों को वंचित छोड़ देते हैं, CASCADE ने अनुभव को सभी के लिए निष्पक्ष बनाए रखा, यह सुनिश्चित करते हुए कि "बैकपैक" और "विशाल सूटकेस" दोनों वाले यात्रियों को समय पर सेवा मिले। इसने यह हासिल किया क्योंकि इसने गतिशील रूप से यह निर्णय लिया कि डेटा को तेज़ मेमोरी से प्राप्त करना है, धीमे स्टोरेज से, या बस इसे फिर से कैलकुलेट (re-calculate) करना है, और यह पूरी तरह से इस बात पर आधारित था कि उस विशिष्ट अनुरोध के पास कितना टाइम बजट उपलब्ध है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →