← Últimos artículos
🤖 machine learning

Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving

Cascade es un sistema de servicio de LLM que aprovecha un presupuesto de latencia dinámico por solicitud para optimizar conjuntamente la programación y la gestión del caché KV, mejorando así significativamente el rendimiento de cumplimiento de SLO y la equidad, al tiempo que reduce las violaciones en comparación con los enfoques tradicionales de primero en llegar, primero en ser atendido.

Autores originales: Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair, Daniel Berger, Pantea Zardoshti, Rodrigo Fonseca, Esha Choukse

Publicado 2026-08-10
📖 4 min de lectura☕ Lectura para el café

Autores originales: Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair, Daniel Berger, Pantea Zardoshti, Rodrigo Fonseca, Esha Choukse

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina una bulliciosa estación de tren de alta velocidad donde miles de pasajeros intentan abordar diferentes trenes al mismo tiempo. Algunos pasajeros acaban de traer una sola mochila (una pregunta corta y rápida), mientras que otros arrastran maletas enormes y pesadas llenas de años de recuerdos (una historia larga y compleja o una tarea de razonamiento profundo). En el mundo de la Inteligencia Artificial, estos "trenes" son los Modelos de Lenguaje Extensos (LLM, por sus siglas en inglés): las computadoras superinteligentes que impulsan los chatbots, los asistentes de programación y los agentes de razonamiento. Los "pasajeros" son las solicitudes que les enviamos.

Para que estos sistemas se sientan rápidos y útiles, tienen que prometer entregar respuestas dentro de un límite de tiempo específico, conocido como Objetivo de Nivel de Servicio (SLO). Piensa en esto como un boleto que dice: "Debes estar en el tren y en movimiento en 5 segundos". El problema es que los gerentes de la estación han estado usando una regla muy antigua: "Primero en llegar, primero en ser atendido". Esto significa que si un pasajero con una maleta gigante llega primero, todos los demás tienen que esperar detrás de ellos, incluso si la persona de atrás solo tiene una pequeña mochila y podría ser atendida en una fracción de segundo. Esto causa un atasco masivo. Además, la estación tiene una cantidad limitada de almacenamiento de alta velocidad (como una sala de espera VIP) para el equipaje de los pasajeros. Si el equipaje se almacena en un almacén lento y distante, buscarlo toma tiempo. Si el gerente de la estación no sabe cuánto tiempo le queda a cada pasajero antes de que su tren parta, podría desperdiciar segundos preciosos buscando equipaje para alguien que ya llega tarde, mientras alguien más que llega a tiempo se queda atrás.

Este es el desafío que aborda un nuevo sistema llamado CASCADE, descrito en un artículo reciente de investigadores de la Universidad de Columbia Británica, Microsoft Azure Research y NVIDIA. Los investigadores se dieron cuenta de que cada solicitud tiene un "presupuesto de tiempo" oculto: la diferencia entre el tiempo que necesita terminar su trabajo y el tiempo que se le permite tomar. Algunas solicitudes tienen un presupuesto enorme (mucho tiempo extra), mientras que otras casi no tienen ninguno. El artículo argumenta que, en lugar de solo mirar quién llegó primero o qué tan grande es la solicitud, el sistema debería mirar este presupuesto de tiempo restante para decidir quién sigue y cómo manejar sus datos.

La idea central de CASCADE es tratar este presupuesto de tiempo como una moneda compartida para dos trabajos diferentes: decidir el orden de las solicitudes y gestionar dónde viven sus datos. En las simulaciones del artículo, que utilizaron datos de tráfico del mundo real de servidores de producción y fueron probadas en tres gigantescos modelos de IA (Qwen-2.5-72B, Llama-3-70B y Llama-3-405B), CASCADE mostró resultados impresionantes. Al calcular constantemente cuánto "margen de tiempo" le quedaba a cada solicitud, el sistema pudo priorizar aquellas que se estaban quedando sin tiempo, permitiendo al mismo tiempo que las solicitudes con mucho tiempo esperaran un poco más o buscaran sus datos en un almacenamiento más lento y económico.

Los hallazgos sugieren que este enfoque es un cambio de reglas de juego para la eficiencia. En sus pruebas, CASCADE mejoró el número de solicitudes exitosas que el sistema podía manejar (llamado "goodput") hasta 2.4 veces en comparación con el método estándar de "primero en llegar, primero en ser atendido" utilizado por sistemas populares como vLLM. Más importante aún, redujo el número de solicitudes que incumplieron sus límites de tiempo (violaciones de SLO) en un 40%. Quizás de la manera más creativa, lo hizo sin hacer que las solicitudes largas y complejas sufrieran. A diferencia de otros métodos que podrían apresurar a los pasajeros de "mochila" y dejar con hambre a los de "maleta gigante", CASCADE mantuvo la experiencia justa para todos, asegurando que tanto los pasajeros de la "mochila" como los de la "maleta gigante" fueran atendidos a tiempo. El sistema lo logró decidiendo dinámicamente si buscar datos en la memoria rápida, en el almacenamiento más lento o simplemente volver a calcularlos, basándose enteramente en si esa solicitud específica tenía suficiente presupuesto de tiempo para absorber el retraso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →