← Últimos artículos
💻 computer science

DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference

Este artículo presenta DriftSched, un marco de planificación consciente de la QoS para la inferencia de LLM multi-inquilino que utiliza un mecanismo de retroalimentación en línea para corregir los errores de estimación de tokens en tiempo de ejecución, demostrando que si bien la calibración adaptativa mejora significativamente la precisión de la estimación, la política de planificación de el Trabajo Más Corto Primero (SJF) produce las reducciones más sustanciales en la latencia de extremo a extremo y en la latencia de cola.

Autores originales: Kathiravan Palaniappan

Publicado 2026-06-03
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Kathiravan Palaniappan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que diriges un restaurante muy popular con una sola cocina (la GPU) y un solo chef. Tienes tres tipos de clientes:

  1. VIPs (Premium): Que quieren su comida rápido y están dispuestos a pagar extra.
  2. Clientes Regulares (Estándar): Que solo quieren una comida normal.
  3. Compradores al por mayor (Batch): Que están pidiendo bandejas enormes de catering y no les importa esperar.

¿El problema? La cocina se ve abrumada. Los pedidos se acumulan y algunos esperan una eternidad mientras otros son atendidos rápidamente. El chef necesita decidir a quién cocinarle después. Esto se llama "programación" (scheduling).

El problema central: Adivinar la carga de trabajo

Para decidir a quién atender después, el programador necesita saber cuánto trabajo representa cada pedido.

  • ¿Es una ensalada sencilla (trabajo corto)?
  • ¿O es una cena compleja de 5 tiempos (trabajo largo)?

Si el programador adivina mal, se produce el caos. Si piensa que un pedido enorme de catering es pequeño, podría atenderlo antes que un aperitivo rápido de un VIP, haciendo que el VIP espere demasiado. Esto se llama "Clasificación Errónea de la Carga de Trabajo" (Workload Misclassification).

Las dos formas de adivinar

El artículo, DriftSched, pone a prueba dos formas de adivinar qué tan grande es un pedido:

  1. La "Adivinanza Perezosa" (Proxy de Espacios en Blanco/Whitespace Proxy): Imagina contar las palabras en el ticket del pedido. Si tiene 10 palabras, probablemente es pequeño. Si tiene 100, es grande. Esto es rápido y fácil para el anfitrión, pero es inexacto. Una frase corta puede ser compleja de cocinar, y una frase larga puede ser simple.
  2. La "Adivinanza del Experto" (Conciencia del Tokenizador/Tokenizer-Aware): Imagina que el anfitrión realmente lee la receta y sabe exactamente cuántos ingredientes y pasos involucra. Esto es preciso, pero toma un poco más de tiempo y esfuerzo para que el anfitrión lo calcule.

La Solución: DriftSched

DriftSched es un sistema inteligente que gestiona este restaurante. Tiene una característica especial llamada "Calibración Adaptativa" (o EMA).

Piénsalo de esta manera: Si el anfitrión usa la "Adivinanza Perezosa" y se da cuenta de que consistentemente subestimó cuánto tiempo toma un plato de "Reporte Técnico", DriftSched aprende de sus errores. Dice: "Ah, cada vez que adivinamos que un Reporte Técnico es pequeño, en realidad tarda un 20% más. La próxima vez, añadiré un 20% a la estimación".

Con el tiempo, la "Adivinanza Perezosa" se vuelve casi tan buena como la "Adivinanza del Experto" porque el sistema corrige sus propios errores basándose en lo que realmente sucedió en la cocina.

Las cinco estrategias de programación

El artículo probó cinco reglas para decidir quién come después:

  1. FIFO (First-In, First-Out): Como una fila estándar de tickets. El primero en llegar es el primero en ser atendido. Es justo, pero si un Comprador al por mayor está delante de ti con un pedido enorme, esperarás una eternidad.
  2. Prioridad (Priority): Los VIPs siempre saltan al frente de la fila. Los Regulares y los Compradores al por mayor esperan. Genial para los VIPs, terrible para todos los demás.
  3. Ponderada (Weighted): Un compromiso. Los VIPs son atendidos el 50% de las veces, los Regulares el 30% y los Compradores al por mayor el 20%. Todos tienen su turno, pero los VIPs reciben más atención.
  4. SJF (Shortest-Job-First / El Trabajo Más Corto Primero): El chef siempre elige el pedido más pequeño y rápido a continuación, independientemente de quién lo haya pedido. Si un Comprador al por mayor tiene un acompañamiento diminuto, se cocina antes que el plato principal de un VIP.
  5. Prioridad por Envejecimiento (Aging Priority): Como la Prioridad, pero si un Comprador al por mayor espera demasiado, su ticket recibe un "sello" que aumenta su prioridad para que no muera de hambre.

¿Qué descubrieron?

1. La precisión importa, pero la estrategia importa más
Usar la "Adivinanza del Experto" (Tokenizador) es mejor que la "Adivinanza Perezosa" (Espacios en blanco). Sin embargo, la regla que usas para elegir al siguiente cliente (la Política de Programación) tiene un impacto mucho mayor en los tiempos de espera que qué tan precisamente adivinaste el tamaño del pedido.

2. SJF es el rey de la velocidad
La regla SJF (El Trabajo Más Corto Primero) fue la más rápida. Redujo el tiempo de espera promedio en aproximadamente un 42% en comparación con la fila estándar (FIFO). ¿Por qué? Porque al despejar primero todos los pedidos pequeños y rápidos, la cocina se mantiene ocupada y eficiente, y menos personas se quedan esperando detrás de un pedido gigante.

3. Priority es el rey de los VIPs
Si te importa mantener contentos a tus VIPs, la Programación por Prioridad (Priority Scheduling) es la mejor. Los VIPs esperaron solo ~77 segundos, mientras que los Compradores al por mayor esperaron ~427 segundos. SJF, por otro lado, no se preocupaba por quién eras; solo le importaba qué tan pequeño era tu pedido. De hecho, bajo SJF, los Compradores al por mayor a veces eran atendidos más rápido que los VIPs porque sus pedidos resultaban ser más pequeños.

4. La "Adivinanza Perezosa" se puede arreglar
La función de autocorrección del sistema (EMA) funcionó bien. Cuando se usaba la "Adivinanza Perezosa" inexacta, el sistema aprendía a ajustar sus estimaciones con el tiempo, reduciendo los errores en un 40%. Sin embargo, si ya usas la "Adivinanza del Experto", la autocorrección no ayuda mucho porque las adivinanzas ya eran precisas.

La conclusión fundamental

  • Si quieres el servicio más rápido en general: Usa SJF (El Trabajo Más Corto Primero). Despeja la cola más rápido.
  • Si quieres proteger a tus clientes más importantes: Usa la Programación por Prioridad. Garantiza que los VIPs sean atendidos primero, incluso si eso hace que los demás esperen más.
  • No te preocupes demasiado por tener una adivinación perfecta: Incluso si tienes una estimación aproximada de cuánto tiempo toma un pedido, la regla de programación que elijas (SJF vs. Prioridad) importa mucho más para el tiempo de espera final. Pero si puedes adivinar con precisión (usando el Tokenizador), el sistema funciona mejor.

En resumen: Cómo haces la fila de los clientes importa más que qué tan perfectamente estimas el tamaño de su pedido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →