Prism: Cost-Efficient Multi-LLM Serving via GPU Memory Ballooning
प्रिज्म (Prism) एक मेमोरी-केंद्रित LLM को-सर्विंग फ्रेमवर्क है जो 'kvcached' नामक एक नवीन मेमोरी बैलूनिंग तकनीक का उपयोग करता है, जो कई मॉडलों के बीच GPU मेमोरी को गतिशील रूप से पुनः प्राप्त करने और पुनर्वितरित करने के लिए स्थानिक और लौकिक साझाकरण (spatial and temporal sharing) को एकीकृत करता है, जिससे उत्पादन वातावरण में लागत-दक्षता और SLO अनुपालन में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल होटल चलाते हैं जिसमें हज़ारों कमरे (GPUs) और हज़ारों अलग-अलग मेहमान (AI मॉडल्स) हैं। कुछ मेहमान मशहूर हस्तियां (celebrities) हैं जो 24/7 एक कमरा चाहती हैं, जबकि कुछ पर्यटक (tourists) हैं जो दिन में केवल एक बार 10 मिनट के लिए चेक-इन करने आते हैं।
समस्या यह है कि इस होटल को चलाना बहुत महंगा है। यदि आप हर पर्यटक को सिर्फ इसलिए अपना निजी कमरा देते हैं कि वे कभी भी आ सकते हैं, तो आपका 90% होटल खाली और बर्बाद रहेगा। लेकिन यदि आप सभी को एक ही कमरे में ठूँसने की कोशिश करते हैं, तो अराजकता फैल जाएगी और मशहूर हस्तियां नाराज़ हो जाएंगी क्योंकि उन्हें इंतज़ार करना पड़ेगा।
Prism एक नया, स्मार्ट होटल मैनेजर है जो "मेमोरी बैलूनिंग" (Memory Ballooning) नामक एक ट्रिक का उपयोग करके इस समस्या को हल करता है।
यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:
1. समस्या: "स्टैटिक रूम" का जाल (The "Static Room" Trap)
AI चलाने के पुराने तरीके में, यदि किसी मॉडल (मेहमान) को एक कमरा आवंटित किया जाता था, तो वह कमरा हमेशा के लिए उसका होता था, भले ही वह सो रहा हो (idle)।
- स्पेस शेयरिंग (पुराना तरीका): आप एक ही कमरे में कई मेहमानों को रखने की कोशिश करते हैं। यह तब बहुत अच्छा काम करता है जब वे सभी जाग रहे हों और बातचीत कर रहे हों। लेकिन अगर एक मेहमान एक हफ्ते के लिए चला जाता है, तो उसका कमरे का आधा हिस्सा खाली पड़ा रहता है, और दूसरा मेहमान उसका उपयोग नहीं कर सकता।
- टाइम शेयरिंग (दूसरा पुराना तरीका): आप दूसरे को अंदर आने देने के लिए एक मेहमान को बाहर निकाल देते हैं। यह तब काम करता है जब मेहमान अलग-अलग समय पर आते हैं। लेकिन अगर दो मेहमान ठीक एक ही सेकंड में पहुँच जाते हैं, तो आपको लगातार एक को अंदर और दूसरे को बाहर करना पड़ता है। यह "बाहर निकालना" धीमा है और इससे सभी को इंतज़ार करना पड़ता है (लैग), जिससे वे अपनी समय सीमा (deadlines) चूक जाते हैं।
वास्तविक दुनिया का AI ट्रैफिक अस्त-व्यस्त होता है। कभी-कभी मॉडल्स का एक समूह एक साथ व्यस्त हो जाता है, और कभी-कभी वे सभी शांत हो जाते हैं। कोई भी एक पुरानी रणनीति इस बदलाव को संभाल नहीं सकती थी।
2. समाधान: "बैलूनिंग" की ट्रिक
Prism एक नया मैनेजर पेश करता है जिसे kvcached (बैलून ड्राइवर) कहा जाता है। कल्पना कीजिए कि GPU मेमोरी को निश्चित कमरों के सेट के रूप में नहीं, बल्कि फूले हुए गुब्बारों (inflatable balloons) के रूप में देखा जा रहा है।
- इलास्टिक बैलून (Elastic Balloon): जब एक मॉडल व्यस्त होता है और उसे अधिक स्थान की आवश्यकता होती है, तो मैनेजर उसके बैलून को फुला देता है, जिससे वह अन्य मॉडल्स जो वर्तमान में सो रहे हैं, उनकी खाली हवा चुरा लेता है।
- दूसरों के लिए डिफ्लेट करना: जब एक मॉडल सो जाता है, तो उसका बैलून सिकुड़ जाता है, जिससे वह जगह मुक्त हो जाती है ताकि एक नया, जागता हुआ मॉडल तुरंत अपना बैलून फुला सके।
- कोई फर्नीचर नहीं हटाना: सबसे अच्छी बात यह है कि मॉडल्स को पता भी नहीं चलता कि यह सब हो रहा है। उन्हें बस एक ऐसा कमरा दिखता है जो जादुई रूप से फैलता और सिकुड़ता है। मैनेजर पर्दे के पीछे सारा भारी काम संभाल लेता है।
3. दो-चरणीय रणनीति (The Two-Step Strategy)
Prism यह तय करने के लिए दो स्मार्ट नियमों का उपयोग करता है कि किसे हवा मिलेगी:
- नियम 1: ग्लोबल शेड्यूलर (होटल मैनेजर): यह पूरे होटल को देखता है। यह पूछता है, "मेहमानों का कौन सा समूह वर्तमान में सक्रिय है?" फिर यह उन सक्रिय मेहमानों को एक ही फ्लोर (GPU) पर रखता है ताकि वे आसानी से जगह साझा कर सकें। यदि कोई मेहमान सो रहा है, तो यह उसे एक स्टोरेज क्लोजेट (CPU) में ले जाता है ताकि जगह खाली की जा सके। यह लगातार होटल को पुनर्गठित करता है ताकि यह सुनिश्चित हो सके कि कोई भी फ्लोर ओवरक्राउडेड न हो जबकि दूसरा खाली हो।
- नियम 2: लोकल शेड्यूलर (कंसीयर्ज/Concierge): यह अभी आ रहे विशिष्ट अनुरोधों को देखता है। यदि दो मेहमान आखिरी बची हुई जगह के लिए लड़ रहे हैं, तो कंसीयर्ज यह जाँचता है कि किसके पास सबसे ज़रूरी डेडलाइन है। यह ज़रूरी मेहमान को पहले अंदर आने देता है और कम ज़रूरी वाले को थोड़ा इंतज़ार करने के लिए कहता है। यह सुनिश्चित करता है कि सबसे महत्वपूर्ण कार्य समय पर पूरे हों।
4. परिणाम
पेपर ने वास्तविक दुनिया के डेटा पर Prism का परीक्षण किया और पाया:
- तेज़ सेवा: इसने पिछले तरीकों की तुलना में अपने स्पीड वादों (SLOs) को 3.3 गुना बेहतर तरीके से पूरा किया।
- कम लागत: प्रदर्शन के समान स्तर को प्राप्त करने के लिए, Prism को आधे GPU की आवश्यकता थी (या यह समान हार्डवेयर के साथ दोगुने अनुरोधों को संभाल सकता था)।
- वास्तविक दुनिया का प्रमाण: इसे पहले से ही 10,000 से अधिक GPU वाले प्रोडक्शन वातावरण में तैनात किया जा चुका है, जिससे कंपनियों को बेकार "इडल" समय को बिल योग्य काम में बदलकर प्रति GPU काफी अधिक राजस्व उत्पन्न करने में मदद मिल रही है।
सारांश
Prism एक स्मार्ट, इलास्टिक होटल मैनेजर की तरह है। मेहमानों को निश्चित कमरों में लॉक करने या उन्हें लगातार बाहर निकालने के बजाय, यह स्थान को गतिशील रूप से साझा करने के लिए फूले हुए गुब्बारों (inflatable balloons) का उपयोग करता है। यह व्यस्त मॉडल्स के लिए जगह बढ़ाता है और सोते हुए मॉडल्स के लिए जगह कम करता है, जिससे यह सुनिश्चित होता है कि होटल हमेशा भरा हुआ, कुशल और तेज़ रहे, बिना किसी के लाइन में इंतज़ार किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।