Multi-Tenant Edge-Cloud Hybrid LLM Serving using Speculative Decoding and Quantization
Este artículo propone una arquitectura de servicio de LLM híbrida de borde-nube multi-inquilino que combina la decodificación especulativa cuantizada en W4A16 con comunicación asíncrona y un orquestador de verificación multi-inquilino para abordar simultáneamente los desafíos de privacidad, latencia y utilización de recursos.