← Últimos artículos
🤖 AI

Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

Este artículo presenta un estudio empírico que revela que la programación de LLM de múltiples modelos en hardware heterogéneo enfrenta una degradación del rendimiento significativa y dependiente del modelo debido a la descarga entre CPU y GPU, así como una sobrecarga sustancial de preempción impulsada por la recarga de estados, identificando así factores críticos para el diseño de programadores de próxima generación eficientes.

Autores originales: Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

Publicado 2026-05-20
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que gestionas una cocina muy concurrida (un servidor informático) con unos pocos chefs super rápidos (GPUs) y un asistente de despensa más lento, pero con mucho espacio (la CPU). Tu objetivo es cocinar muchos tipos diferentes de platos complejos (Modelos de Lenguaje Grande o LLMs) al mismo tiempo. A veces, la cocina se satura tanto que los chefs rápidos se quedan sin espacio en la encimera, por lo que tienes que pedirle al asistente de despensa que ayude a sostener algunos ingredientes o incluso que haga parte del picado.

Este artículo es como un estudio detallado de lo que sucede cuando intentas dividir el trabajo de cocina entre los chefs rápidos y el asistente lento, o cuando tienes que detener repentinamente un plato para cocinar uno más urgente.

Aquí están los principales descubrimientos del estudio, explicados de forma sencilla:

1. El problema del "Medio Chef" (Descarga)

Cuando un plato es demasiado grande para la encimera del chef, mueves algunos pasos de la receta al asistente de despensa.

  • El hallazgo: No es un intercambio suave. Si mueves solo un poco del trabajo al asistente lento, la velocidad de cocina no disminuye un poco; se desploma estrepitosamente.
  • La analogía: Piénsalo como una carrera de relevos. Si el corredor rápido (GPU) tiene que pasar el testigo a un caminante lento (CPU) incluso por una parte diminuta de la carrera, todo el equipo se ralentiza drásticamente.
  • La sorpresa: Los platos pequeños (modelos de IA más pequeños) son los que más sufren. Si intentas descargar incluso una pequeña parte de un modelo pequeño, se vuelve muy lento. Los platos más grandes (modelos más grandes) manejan la división mejor, ralentizándose de forma más gradual.
  • La lección: No puedes adivinar simplemente cuánto trabajo darle a la CPU. Tienes que saber exactamente qué "plato" estás cocinando, porque algunos modelos odian ser divididos más que otros.

2. El "Costo de Cambio" (Preemptión)

A veces, un cliente VIP pide un nuevo plato y tienes que detener al chef actual, limpiar su estación y empezar el nuevo. Esto se llama "preemptión".

  • El hallazgo: El tiempo que tarda en cambiar de plato es casi el mismo, ya sea que detengas el plato actual después de 1 minuto o después de 1 hora.
  • La analogía: Imagina que estás pintando un mural gigante. Si tienes que detenerte para dejar que alguien más pinte, el tiempo que tarda en limpiar tus pinceles y preparar los pinceles del nuevo pintor es el mismo, ya hayas pintado 3 metros o 300 metros. El tiempo que pasaste pintando no importa; el tiempo que tarda en cambiar es fijo.
  • La gran revelación: La mayoría de la gente pensaba que el tiempo dedicado a mover las "notas" (la memoria de lo que ya se había pintado, llamada caché KV) era la parte lenta. El estudio descubrió que mover las notas es en realidad instantáneo (menos del 1% del tiempo). El verdadero desperdiciador de tiempo es desempaquetar las herramientas del chef antiguo y desempaquetar las herramientas del nuevo chef (cargar los pesos del modelo desde el disco duro).
  • La lección: Cambiar de tareas es costoso, pero el costo es predecible. Depende enteramente de lo pesado que sea el "kit de herramientas" (el tamaño del modelo), no de cuánto tiempo haya estado funcionando el trabajo.

3. El "Atasco de Tráfico" (Movimiento de Datos)

Al mover cosas entre el chef rápido y el asistente lento, tienen que caminar por un pasillo (el cable de datos).

  • El hallazgo: Incluso cuando las "notas" (memoria) se vuelven enormes porque el plato es muy largo, moverlas sigue siendo súper rápido en comparación con desempaquetar las herramientas.
  • La analogía: Es como mover una sola hoja de papel versus mover una estantería completa. Mover la hoja (las notas) es tan rápido que apenas cuenta. Mover la estantería (las herramientas del modelo) tarda una eternidad.
  • La lección: No te preocupes demasiado por el tamaño de las "notas" al decidir cambiar de tareas. Preocúpate por el tamaño de la "estantería".

4. La "Personalidad del Hardware"

El estudio probó dos tipos diferentes de cocinas (dos GPUs diferentes).

  • El hallazgo: Una cocina era más rápida cocinando pero más lenta cambiando de tareas que la otra.
  • La analogía: Una cocina tiene un chef super rápido pero un pasillo estrecho, lo que dificulta cambiar las herramientas rápidamente. La otra tiene un chef ligeramente más lento pero un pasillo ancho, lo que facilita los cambios.
  • La lección: No puedes usar una regla de "talla única". La mejor manera de programar tareas depende exactamente de qué hardware tengas.

Resumen para el Futuro

Los autores concluyen que la próxima generación de "Gerentes de Cocina" (planificadores) necesita ser más inteligente. No deberían mirar solo cuántos pedidos hay en la cola. Necesitan saber:

  1. ¿Qué modelo es? (Algunos odian ser divididos).
  2. ¿Qué tan grande es el kit de herramientas? (Esto determina cuánto tarda un cambio).
  3. ¿Qué tipo de cocina es esta? (Diferentes hardware cambian las reglas).

Al comprender estas peculiaridades específicas, los gerentes pueden dejar de intentar forzar un clavo cuadrado en un agujero redondo y, en su lugar, crear un sistema que ejecute muchos modelos de IA diferentes de manera eficiente sin colapsar la cocina.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →