Multi-Tenant Edge-Cloud Hybrid LLM Serving using Speculative Decoding and Quantization
Questo articolo propone un'architettura di servizio per LLM ibrida edge-cloud multi-tenant che combina il decoding speculativo quantizzato W4A16 con la comunicazione asincrona e un orchestratore di verifica multi-tenant per affrontare simultaneamente le sfide relative alla privacy, alla latenza e all'utilizzo delle risorse.