← नवीनतम पेपर
🤖 AI

Prism: Cost-Efficient Multi-LLM Serving via GPU Memory Ballooning

प्रिज्म (Prism) एक मेमोरी-केंद्रित LLM को-सर्विंग फ्रेमवर्क है जो 'kvcached' नामक एक नवीन मेमोरी बैलूनिंग तकनीक का उपयोग करता है, जो कई मॉडलों के बीच GPU मेमोरी को गतिशील रूप से पुनः प्राप्त करने और पुनर्वितरित करने के लिए स्थानिक और लौकिक साझाकरण (spatial and temporal sharing) को एकीकृत करता है, जिससे उत्पादन वातावरण में लागत-दक्षता और SLO अनुपालन में सुधार होता है।

मूल लेखक: Shan Yu, Yifan Qiao, Mingyuan Ma, Yangmin Li, Shuo Yang, Xinyuan Tong, Yang Wang, Zhiqiang Xie, Yuwei An, Shiyi Cao, Ke Bao, Deepak Vij, Xiaoning Ding, Yichen Wang, Qingda Lu, Zhong Wang, Gao Gao, Har
प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shan Yu, Yifan Qiao, Mingyuan Ma, Yangmin Li, Shuo Yang, Xinyuan Tong, Yang Wang, Zhiqiang Xie, Yuwei An, Shiyi Cao, Ke Bao, Deepak Vij, Xiaoning Ding, Yichen Wang, Qingda Lu, Zhong Wang, Gao Gao, Harry Xu, Junyi Shu, Jiarong Xing, Ying Sheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल होटल चलाते हैं जिसमें हज़ारों कमरे (GPUs) और हज़ारों अलग-अलग मेहमान (AI मॉडल्स) हैं। कुछ मेहमान मशहूर हस्तियां (celebrities) हैं जो 24/7 एक कमरा चाहती हैं, जबकि कुछ पर्यटक (tourists) हैं जो दिन में केवल एक बार 10 मिनट के लिए चेक-इन करने आते हैं।

समस्या यह है कि इस होटल को चलाना बहुत महंगा है। यदि आप हर पर्यटक को सिर्फ इसलिए अपना निजी कमरा देते हैं कि वे कभी भी आ सकते हैं, तो आपका 90% होटल खाली और बर्बाद रहेगा। लेकिन यदि आप सभी को एक ही कमरे में ठूँसने की कोशिश करते हैं, तो अराजकता फैल जाएगी और मशहूर हस्तियां नाराज़ हो जाएंगी क्योंकि उन्हें इंतज़ार करना पड़ेगा।

Prism एक नया, स्मार्ट होटल मैनेजर है जो "मेमोरी बैलूनिंग" (Memory Ballooning) नामक एक ट्रिक का उपयोग करके इस समस्या को हल करता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. समस्या: "स्टैटिक रूम" का जाल (The "Static Room" Trap)

AI चलाने के पुराने तरीके में, यदि किसी मॉडल (मेहमान) को एक कमरा आवंटित किया जाता था, तो वह कमरा हमेशा के लिए उसका होता था, भले ही वह सो रहा हो (idle)।

  • स्पेस शेयरिंग (पुराना तरीका): आप एक ही कमरे में कई मेहमानों को रखने की कोशिश करते हैं। यह तब बहुत अच्छा काम करता है जब वे सभी जाग रहे हों और बातचीत कर रहे हों। लेकिन अगर एक मेहमान एक हफ्ते के लिए चला जाता है, तो उसका कमरे का आधा हिस्सा खाली पड़ा रहता है, और दूसरा मेहमान उसका उपयोग नहीं कर सकता।
  • टाइम शेयरिंग (दूसरा पुराना तरीका): आप दूसरे को अंदर आने देने के लिए एक मेहमान को बाहर निकाल देते हैं। यह तब काम करता है जब मेहमान अलग-अलग समय पर आते हैं। लेकिन अगर दो मेहमान ठीक एक ही सेकंड में पहुँच जाते हैं, तो आपको लगातार एक को अंदर और दूसरे को बाहर करना पड़ता है। यह "बाहर निकालना" धीमा है और इससे सभी को इंतज़ार करना पड़ता है (लैग), जिससे वे अपनी समय सीमा (deadlines) चूक जाते हैं।

वास्तविक दुनिया का AI ट्रैफिक अस्त-व्यस्त होता है। कभी-कभी मॉडल्स का एक समूह एक साथ व्यस्त हो जाता है, और कभी-कभी वे सभी शांत हो जाते हैं। कोई भी एक पुरानी रणनीति इस बदलाव को संभाल नहीं सकती थी।

2. समाधान: "बैलूनिंग" की ट्रिक

Prism एक नया मैनेजर पेश करता है जिसे kvcached (बैलून ड्राइवर) कहा जाता है। कल्पना कीजिए कि GPU मेमोरी को निश्चित कमरों के सेट के रूप में नहीं, बल्कि फूले हुए गुब्बारों (inflatable balloons) के रूप में देखा जा रहा है।

  • इलास्टिक बैलून (Elastic Balloon): जब एक मॉडल व्यस्त होता है और उसे अधिक स्थान की आवश्यकता होती है, तो मैनेजर उसके बैलून को फुला देता है, जिससे वह अन्य मॉडल्स जो वर्तमान में सो रहे हैं, उनकी खाली हवा चुरा लेता है।
  • दूसरों के लिए डिफ्लेट करना: जब एक मॉडल सो जाता है, तो उसका बैलून सिकुड़ जाता है, जिससे वह जगह मुक्त हो जाती है ताकि एक नया, जागता हुआ मॉडल तुरंत अपना बैलून फुला सके।
  • कोई फर्नीचर नहीं हटाना: सबसे अच्छी बात यह है कि मॉडल्स को पता भी नहीं चलता कि यह सब हो रहा है। उन्हें बस एक ऐसा कमरा दिखता है जो जादुई रूप से फैलता और सिकुड़ता है। मैनेजर पर्दे के पीछे सारा भारी काम संभाल लेता है।

3. दो-चरणीय रणनीति (The Two-Step Strategy)

Prism यह तय करने के लिए दो स्मार्ट नियमों का उपयोग करता है कि किसे हवा मिलेगी:

  • नियम 1: ग्लोबल शेड्यूलर (होटल मैनेजर): यह पूरे होटल को देखता है। यह पूछता है, "मेहमानों का कौन सा समूह वर्तमान में सक्रिय है?" फिर यह उन सक्रिय मेहमानों को एक ही फ्लोर (GPU) पर रखता है ताकि वे आसानी से जगह साझा कर सकें। यदि कोई मेहमान सो रहा है, तो यह उसे एक स्टोरेज क्लोजेट (CPU) में ले जाता है ताकि जगह खाली की जा सके। यह लगातार होटल को पुनर्गठित करता है ताकि यह सुनिश्चित हो सके कि कोई भी फ्लोर ओवरक्राउडेड न हो जबकि दूसरा खाली हो।
  • नियम 2: लोकल शेड्यूलर (कंसीयर्ज/Concierge): यह अभी आ रहे विशिष्ट अनुरोधों को देखता है। यदि दो मेहमान आखिरी बची हुई जगह के लिए लड़ रहे हैं, तो कंसीयर्ज यह जाँचता है कि किसके पास सबसे ज़रूरी डेडलाइन है। यह ज़रूरी मेहमान को पहले अंदर आने देता है और कम ज़रूरी वाले को थोड़ा इंतज़ार करने के लिए कहता है। यह सुनिश्चित करता है कि सबसे महत्वपूर्ण कार्य समय पर पूरे हों।

4. परिणाम

पेपर ने वास्तविक दुनिया के डेटा पर Prism का परीक्षण किया और पाया:

  • तेज़ सेवा: इसने पिछले तरीकों की तुलना में अपने स्पीड वादों (SLOs) को 3.3 गुना बेहतर तरीके से पूरा किया।
  • कम लागत: प्रदर्शन के समान स्तर को प्राप्त करने के लिए, Prism को आधे GPU की आवश्यकता थी (या यह समान हार्डवेयर के साथ दोगुने अनुरोधों को संभाल सकता था)।
  • वास्तविक दुनिया का प्रमाण: इसे पहले से ही 10,000 से अधिक GPU वाले प्रोडक्शन वातावरण में तैनात किया जा चुका है, जिससे कंपनियों को बेकार "इडल" समय को बिल योग्य काम में बदलकर प्रति GPU काफी अधिक राजस्व उत्पन्न करने में मदद मिल रही है।

सारांश

Prism एक स्मार्ट, इलास्टिक होटल मैनेजर की तरह है। मेहमानों को निश्चित कमरों में लॉक करने या उन्हें लगातार बाहर निकालने के बजाय, यह स्थान को गतिशील रूप से साझा करने के लिए फूले हुए गुब्बारों (inflatable balloons) का उपयोग करता है। यह व्यस्त मॉडल्स के लिए जगह बढ़ाता है और सोते हुए मॉडल्स के लिए जगह कम करता है, जिससे यह सुनिश्चित होता है कि होटल हमेशा भरा हुआ, कुशल और तेज़ रहे, बिना किसी के लाइन में इंतज़ार किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →