Multi-Tenant Edge-Cloud Hybrid LLM Serving using Speculative Decoding and Quantization
Dieses Paper schlägt eine Multi-Tenant-Edge-Cloud-Hybrid-LLM-Serving-Architektur vor, die W4A16-quantisiertes spekulatives Dekodieren mit asynchroner Kommunikation und einem Multi-Tenant-Verifikations-Orchestrator kombiniert, um gleichzeitig die Herausforderungen in Bezug auf Datenschutz, Latenz und Ressourcenauslastung zu adressieren.