← Últimos artículos
💻 computer science

Beyond Prediction: Tail-Aware Scheduling for LLM Inference

Este artículo introduce un marco de planificación consciente de la distribución y libre de predicciones que utiliza el aumento de prioridad suave y la interrupción consciente de la caché para reducir significativamente la latencia de cola y el tiempo al primer token en la inferencia de LLM, superando a las políticas tradicionales basadas en predicción incluso bajo condiciones desafiantes como llegadas de ráfagas y presión de memoria GPU.

Autores originales: Yueying Li, Yuanfan Chen, Jiayang Chen, Esha Choukse, Haoran Qiu, G. Edward Suh, Rodrigo Fonseca, Ziv Scully, Udit Gupta

Publicado 2026-06-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yueying Li, Yuanfan Chen, Jiayang Chen, Esha Choukse, Haoran Qiu, G. Edward Suh, Rodrigo Fonseca, Ziv Scully, Udit Gupta

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina una cocina de un restaurante con mucho movimiento donde los chefs (las GPUs) preparan platos para los clientes (las solicitudes de IA). Algunos pedidos son sencillos: "Solo un vaso de agua" (un mensaje de chat corto). Otros son complejos: "Diseña una novela de 50 páginas con una trama detallada" (una tarea de razonamiento larga).

El problema es que el gerente de la cocina no sabe cuánto tiempo tomará ningún pedido hasta que está casi terminado. Un "vaso de agua" puede convertirse en un "menú degustación de 10 platos" si el cliente sigue pidiendo más.

La forma antigua: Adivinar el futuro

Los gerentes de cocina actuales intentan ser eficientes adivinando cuánto tiempo tomará cada pedido. Utilizan una estrategia llamada "El trabajo más corto primero" (SJF, por sus siglas en inglés).

  • La lógica: "Creo que este pedido será rápido, así que lo cocinaré primero para sacarlo de la mesa".
  • El fallo: Si el gerente se equivoca en su predicción (lo cual sucede a menudo con las tareas complejas de IA), el pedido rápido se retrasa, y el pedido largo que se suponía que sería "corto" termina acaparando la estufa para siempre.
  • El resultado: El tiempo de espera promedio parece aceptable, pero los tiempos de espera en el peor de los casos (la latencia de la cola o "tail latency") son terribles. Algunos clientes esperan horas mientras otros son atendidos en segundos. Esto es malo para la experiencia del usuario.

La nueva forma: El sistema "Boost" (UNIBOOST)

Los autores de este artículo proponen un nuevo gerente que deja de adivinar y comienza a observar. Llaman a su sistema UNIBOOST.

Así es como funciona, utilizando analogías sencillas:

1. El "Soft Boost" (Sin necesidad de bolas de cristal)

En lugar de intentar predecir el futuro, el nuevo gerente otorga a cada pedido una "puntuación de prioridad" que cambia suavemente con el tiempo.

  • La analogía: Imagina una fila de personas esperando para subir a una atracción. El nuevo gerente no pregunta: "¿Qué tan lejos vas?". En su lugar, dice: "Cuanto más tiempo hayas estado esperando, más 'impulso' (boost) recibirá tu ticket en prioridad".
  • Cómo ayuda: Los pedidos cortos se sirven rápidamente porque llegan primero. Pero si un pedido largo ha estado esperando un tiempo, recibe un ligero empujón hacia adelante para que no se quede atrapado detrás de un flujo interminable de pedidos nuevos y cortos. Esto evita que la "cola larga" de clientes espere para siempre.

2. El "Guardián de la Memoria" (No desperdicies la sartén)

En la IA, cocinar un plato requiere mucha memoria (el caché KV). Si detienes la cocción de un plato a la mitad para cambiar a uno nuevo, tienes que desechar los ingredientes que acababas de preparar y empezar de nuevo. Esto es costoso y lento.

  • La analogía: Imagina que un chef está a mitad de la preparación de un pastel enorme. Si el gerente grita: "¡Detente! ¡Cocina una galleta en su lugar!", el chef tiene que raspar la masa del pastel de la sartén, lavarla y empezar la galleta. Luego, si cambian de nuevo al pastel, tiene que lavar la sartén otra vez.
  • La solución: El nuevo gerente utiliza un "Guardián de la Memoria". Dice: "Una vez que empieces a cocinar un pastel, debes terminar al menos una 'rebanada' de él antes de que siquiera consideremos cambiar de tarea". Esto evita que la cocina esté cambiando constantemente de tareas y desperdiciando tiempo limpiando sartenes.

3. El "Termostato Adaptativo"

Las condiciones de la cocina cambian. A veces hay una ráfaga de pedidos pequeños; otras veces, hay unos pocos pedidos masivos.

  • La analogía: El gerente tiene un termostato inteligente que observa cuánto tiempo están esperando las personas realmente. Si la fila se alarga demasiado, el gerente ajusta automáticamente los ajustes de "impulso" (boost) para ser más agresivo a la hora de ayudar a las personas que han estado esperando más tiempo. Aprende sobre la marcha sin necesidad de una bola de cristal.

Los resultados

El artículo probó este nuevo sistema contra los sistemas de "adivinación" antiguos utilizando datos del mundo real (como tareas de programación y conversaciones de chat).

  • Los sistemas antiguos: Cuando la carga de trabajo se volvía loca (por ráfagas o "bursty"), los sistemas de "adivinación" fallaban. Los tiempos de espera en el peor de los casos (P99) se volvían enormes.
  • El nuevo sistema (UNIBOOST): No solo mejoró el tiempo de espera promedio; redujo drásticamente los peores tiempos de espera.
    • Redujo el tiempo de espera en el peor de los casos (P99) entre un 35% y un 50% en comparación con los mejores sistemas de "predicción perfecta".
    • Hizo que el primer token apareciera (TTFT) entre un 34% y un 47% más rápido.

La conclusión

El artículo argumenta que intentar predecir cuánto durará una tarea de IA es frágil y a menudo erróneo. En su lugar, un sistema que reacciona a cuánto tiempo han estado esperando las tareas, mientras tiene cuidado de no desperdiciar memoria al cambiar de tareas con demasiada frecuencia, crea una experiencia mucho más justa y rápida para todos. Se trata de gestionar el flujo de la fila, no de adivinar el destino.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →