Multi-Tenant Edge-Cloud Hybrid LLM Serving using Speculative Decoding and Quantization
यह शोध पत्र एक मल्टी-टेनेंट एज-क्लाउड हाइब्रिड LLM सर्विंग आर्किटेक्चर प्रस्तावित करता है जो गोपनीयता, विलंबता (लेटेंसी) और संसाधन उपयोग की चुनौतियों को एक साथ संबोधित करने के लिए एसिंक्रोनस कम्युनिकेशन और एक मल्टी-टेनेंट वेरिफिकेशन ऑर्केस्ट्रेटर के साथ W4A16-क्वांटाइज्ड स्पेकुलेटिव डिकोडिंग को जोड़ता है।