Multi-Tenant Edge-Cloud Hybrid LLM Serving using Speculative Decoding and Quantization
यह शोध पत्र एक मल्टी-टेनेंट एज-क्लाउड हाइब्रिड LLM सर्विंग आर्किटेक्चर प्रस्तावित करता है जो गोपनीयता, विलंबता (लेटेंसी) और संसाधन उपयोग की चुनौतियों को एक साथ संबोधित करने के लिए एसिंक्रोनस कम्युनिकेशन और एक मल्टी-टेनेंट वेरिफिकेशन ऑर्केस्ट्रेटर के साथ W4A16-क्वांटाइज्ड स्पेकुलेटिव डिकोडिंग को जोड़ता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट दिमाग (एक लार्ज लैंग्वेज मॉडल) है जो कहानियाँ लिख सकता है, गणित हल कर सकता है और इंसान की तरह बात कर सकता है। लेकिन एक पेंच है: यह दिमाग इतना विशाल है कि यह आपकी जेब में नहीं समा सकता, और यदि आप इसे हर जगह ले जाने की कोशिश करते हैं, तो आपके फोन की बैटरी तुरंत खत्म हो जाएगी।
तो, हमारे पास दो बुरे विकल्प हैं:
- द क्लाउड (The Cloud): अपने सवालों को दूर बैठे एक विशाल सुपरकंप्यूटर के पास भेजें। यह बुद्धिमान है, लेकिन संदेश को वहां जाने और वापस आने में लंबा समय लगता है (जैसे कबूतर के जरिए पत्र भेजना), जिससे बातचीत धीमी और बोझिल महसूस होती है। इसके अलावा, आपको अपने निजी रहस्यों के लिए उस कबूतर पर भरोसा करना होगा।
- द एज (The Edge): पूरे रोबोट दिमाग को अपने फोन पर चलाने की कोशिश करें। यह तेज़ और निजी है, लेकिन आपका फोन इतना शक्तिशाली नहीं है, और जवाब थोड़े बेवकूफ़ाना हो सकते हैं क्योंकि मॉडल को बहुत अधिक छोटा (shrink) किया गया होगा।
यह पेपर एक चतुर बीच का रास्ता सुझाता है: आपके फोन और क्लाउड के बीच एक टीम-अप जो एक हाई-स्पीड रिले रेस की तरह काम करता है, जिसमें एक ट्विस्ट है।
टीम-अप: "ड्राफ्टिंग" साइडकिक और "वेरिफाइंग" बॉस
यहाँ बताया गया है कि यह नया सिस्टम कैसे काम करता है, लेखकों के अनुसार:
1. द एज साइडकिक (आपका फोन)
क्लाउड के जवाब देने का इंतज़ार करने के बजाय, आपका फोन रोबोट दिमाग के एक छोटे, अत्यंत कॉम्पैक्ट संस्करण को चलाता है। लेखक एक विशिष्ट "श्रिंक-रैप" तकनीक का सुझाव देते हैं जिसे W4A16 क्वांटाइजेशन कहा जाता है। इसे एक हाई-डेफिनिशन मूवी को एक छोटी फ़ाइल में कंप्रेस करने के रूप में सोचें जो अभी भी प्लॉट समझने के लिए पर्याप्त अच्छी दिखती है।
- जादू: यह छोटा संस्करण वाक्य में अगले कुछ शब्दों (टोकन्स) का अनुमान लगाने में काफी तेज़ है। पेपर नोट करता है कि मॉडल को छोटा करने से यह थोड़ा कम सटीक (परप्लेक्सिटी स्कोर 5.47 से लगभग 5.74 या 5.83 हो जाता है) हो जाता है, लेकिन यह एक ठोस अनुमान लगाने के लिए पर्याप्त है।
- नियम: लेखक स्पष्ट रूप से इसे और अधिक छोटा करने (जैसे W4A4) के खिलाफ तर्क देते हैं। वे कहते हैं कि यदि आप इसे बहुत अधिक कंप्रेस करते हैं, तो अनुमान इतने खराब हो जाते हैं कि सिस्टम उन्हें सुधारने में समय बर्बाद करता है, जिससे सब कुछ धीमा हो जाता है। इसलिए, वे "बिल्कुल सही" W4A16 आकार पर टिके रहते हैं।
2. द क्लाउड बॉस (सुपरकंप्यूटर)
जब आपका फोन अगले कुछ शब्दों का अनुमान लगा रहा होता है, तब क्लाउड भारी काम कर रहा होता है। इसके पास पूर्ण आकार का, परफेक्ट रोबोट दिमाग है। इसका काम शून्य से शुरुआत करना नहीं है; इसे बस फोन द्वारा लगाए गए अनुमानों को वेरिफाई (सत्यापित) करना है।
- ट्विस्ट: पुराने सिस्टम में, फोन अनुमान लगाता था, फिर रुक जाता था और क्लाउड के "हाँ" या "नहीं" कहने का इंतज़ार करता था। इसे "म्युचुअल वेटिंग" कहा जाता है, और यह टेनिस के खेल जैसा है जहाँ आप गेंद वापस आने का इंतज़ार करते हैं इससे पहले कि आप अपना रैकेट घुमाएँ।
- नया मूव: यह पेपर एक असिंक्रोनस (asynchronous/non-blocking) प्रोटोकॉल प्रस्तावित करता है। फोन अगले शब्दों का अनुमान लगाना जारी रखता है जबकि क्लाउड पिछले शब्दों की जाँच कर रहा होता है। यह एक कन्वेयर बेल्ट की तरह है जहाँ फोन बॉक्स पैक करना जारी रखता है जबकि क्लाउड पहले से मौजूद बॉक्स पर स्टैम्प लगा रहा होता है। यह नेटवर्क लेटेंसी (यात्रा के समय) को छिपा देता है ताकि आपको देरी महसूस न हो।
3. द मल्टी-टेनेंट ऑर्केस्ट्रा
यहाँ दूसरा बड़ा नुस्खा है। आमतौर पर, यदि 100 लोग क्लाउड का उपयोग कर रहे हैं, तो कंप्यूटर प्रत्येक व्यक्ति को अपना एक छोटा, खाली कमरा देता है। यह बर्बादी है।
लेखक एक मल्टी-टेनेंट ऑर्केस्ट्रेटर (Multi-Tenant Orchestrator) का सुझाव देते हैं। एक व्यस्त रेस्टोरेंट किचन की कल्पना करें। हर ग्राहक को अपना निजी शेफ देने के बजाय (जो ऑर्डर का इंतज़ार करते हुए बैठा रहता है), किचन में एक अत्यंत कुशल टीम होती है जो एक साथ सभी के ऑर्डर लेती है।
- क्लाउड कई अलग-अलग फोन के अनुरोधों को एक साथ चेक करने के लिए एक बड़े "बैच" में समूहित करता है।
- यह क्लाउड के शक्तिशाली ग्राफिक्स कार्ड्स (GPUs) को एक व्यक्ति के टाइप करने का इंतज़ार करने के बजाय 100% क्षमता पर काम करने में मदद करता है।
गणित क्या कहता है (लेकिन इसे सरल रखें)
लेखकों ने एक गणितीय मॉडल बनाया है यह देखने के लिए कि क्या यह विचार काम करता है। उन्होंने अभी तक हजारों लोगों के साथ वास्तविक दुनिया का बड़ा परीक्षण नहीं किया है; इसके बजाय, उन्होंने यह देखने के लिए फॉर्मूलों का उपयोग किया कि सिस्टम को कैसे व्यवहार करना चाहिए।
- स्पीड लिमिट: उन्होंने गणना की कि यदि क्लाउड फोन द्वारा अगला बैच बनाने के दौरान एक बैच के अनुमानों की जाँच करने के लिए पर्याप्त तेज़ है, तो इंटरनेट की देरी समीकरण से गायब हो जाती है।
- बॉटलनेक (Bottleneck): यह सिस्टम तब सबसे अच्छा काम करता है जब क्लाउड पर बहुत अधिक बोझ न हो। यदि बहुत अधिक लोग पार्टी में शामिल हो जाते हैं, तो क्लाउड "क्यूइंग डिले" (कतार में देरी) में फंस जाता है। मॉडल सुझाव देता है कि सिस्टम में कितने लोग हैं, इसका सावधानीपूर्वक संतुलन बनाकर, आप गति को उच्च रख सकते हैं।
- परिणाम: उनके सिमुलेशन में, यह सेटअप सुझाव देता है कि सिस्टम फोन पर पूरी तरह से चलने वाले मॉडल के करीब की गति प्राप्त कर सकता है, लेकिन इसमें विशाल क्लाउड ब्रेन की सटीकता होगी, और यह सब आपके निजी डेटा को मुख्य रूप से आपके डिवाइस पर रखते हुए किया जा सकता है।
यह पेपर क्या नहीं कह रहा है
यह जानना महत्वपूर्ण है कि यह पेपर क्या दावा नहीं कर रहा है:
- इसे अभी तक हजारों उपयोगकर्ताओं के साथ वास्तविक दुनिया के परिनियोजन (deployment) में सिद्ध नहीं किया गया है। लेखक मौजूदा उपकरणों (जैसे फोन के लिए
llama.cppऔर क्लाउड के लिएvLLM) के आधार पर इस आर्किटेक्चर का सुझाव दे रहे हैं। - यह दावा नहीं करता कि यह हर गोपनीयता समस्या को हल करता है। हालांकि यह कच्चे प्रॉम्प्ट्स को स्थानीय रखता है, फिर भी यह कुछ स्पेक्युलेटिव डेटा क्लाउड को भेजता है।
- यह नहीं कहता कि यह किसी भी मॉडल साइज के लिए काम करता है। गणित विशिष्ट स्थितियों पर निर्भर करता है जहाँ क्लाउड फोन की अनुमान लगाने की गति के साथ तालमेल बिठाने के लिए पर्याप्त तेज़ हो।
निचोड़ (The Bottom Line)
लेखक एक ऐसा तरीका प्रस्तावित करते हैं जिससे AI चैट को बिना अपनी जेब में सुपरकंप्यूटर रखे, तत्काल और निजी बनाया जा सके। अपने फोन को त्वरित, "काफी अच्छे" अनुमान लगाने देकर और क्लाउड को एक व्यस्त, कुशल समूह में जाँच करने देकर, वे सुझाव देते हैं कि हम उन धीमी इंटरनेट देरी को बायपास कर सकते हैं जो आमतौर पर अनुभव को खराब कर देती हैं। यह भविष्य के लिए एक आशाजनक ब्लूप्रिंट है, जो बताता है कि यदि हम सही "रिले रेस" टीम बनाते हैं, तो हमारे पास दोनों दुनियाओं का सर्वश्रेष्ठ (बेहतरीन और तेज़) अनुभव होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।