Multi-Tenant Edge-Cloud Hybrid LLM Serving using Speculative Decoding and Quantization
Dit artikel stelt een multi-tenant edge-cloud hybride LLM-servingarchitectuur voor die W4A16-gekwantiseerde speculatieve decodering combineert met asynchrone communicatie en een multi-tenant verificatie-orchestrator om gelijktijdig uitdagingen op het gebied van privacy, latentie en resource-benutting aan te pakken.