← Últimos artículos
🤖 machine learning

ML Inference Scheduling with Predictable Latency

Este artículo identifica limitaciones críticas en los enfoques existentes de programación de inferencia de ML, específicamente su predicción de interferencia de grano grueso y su dependencia de modelos estáticos, lo que conduce a pronósticos de latencia inexactos y SLOs comprometidos bajo cargas de trabajo dinámicas.

Autores originales: Haidong Zhao, Nikolaos Georgantas

Publicado 2026-06-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Haidong Zhao, Nikolaos Georgantas

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La visión general: La cocina de un restaurante con mucho trabajo

Imagina la cocina de un restaurante de alta gama (la GPU) que es increíblemente rápida pero muy cara de mantener. Para ahorrar dinero, el dueño quiere cocinar la mayor cantidad de platos posible a la vez (mejorar la utilización).

En esta cocina, llegan pedidos de diferentes platos (como modelos de Machine Learning). Para ser eficientes, el chef agrupa pedidos similares en un solo "lote" (batch) para cocinarlos todos al mismo tiempo. Por ejemplo, en lugar de cocinar una hamburguesa, luego dos patatas fritas y luego otra hamburguesa, cocina una bandeja de cinco hamburguesas al mismo tiempo.

Sin embargo, la cocina tiene un problema: la interferencia.
Si el chef intenta cocinar una bandeja enorme de hamburguesas y una bandeja de suflés delicados al mismo tiempo en la misma estufa, podrían estorbarse entre sí. El calor podría volverse desigual o el chef podría tener que cambiar de herramientas con demasiada frecuencia. Esto ralentiza todo, haciendo que la comida llegue tarde.

En el mundo de la IA, la "comida tardía" significa latencia. Si un coche autónomo o una videollamada recibe una respuesta demorada porque la cocina estaba demasiado abarrotada, eso es un fallo. El objetivo de este artículo es averiguar cómo programar estos lotes de cocción para que la cocina se mantenga ocupada sin que la comida llegue tarde.

El problema: Adivinar es peligroso

El artículo sostiene que los métodos actuales para predecir cuánto "abarrotamiento" (interferencia) habrá son defectuosos por dos razones principales:

1. El problema de la "instantánea estática" (Granularidad gruesa)

La analogía: Imagina que eres un controlador de tráfico. Miras un mapa y ves un camión rojo y un coche azul en la autopista en este momento. Predices que conducirán uno al lado del otro durante todo el viaje.
La realidad: En la cocina, el camión rojo (Lote 1) podría abandonar la autopista después de 10 segundos, y un camión de carga gigante (Lote 3) podría entrar y quedarse durante 5 minutos.
La afirmación del artículo: Los programadores de IA actuales son como ese controlador de tráfico. Miran quién está en la cocina en este preciso momento y asumen que se quedarán así. Ignoran el hecho de que los lotes llegan y se van en diferentes momentos.

  • Resultado: La predicción es errónea. El sistema piensa que la cocina estará tranquila, pero de repente llega un nuevo lote pesado, causando un atasco y entregas tardías.

2. El problema del "mapa viejo" (Modelos estáticos/no adaptativos)

La analogía: Imagina que entrenaste a un robot chef para predecir tiempos de cocción usando un menú del año pasado. El año pasado, todo el mundo pedía hamburguesas. Este año, todo el mundo pide mariscos complejos.
La realidad: El robot chef sigue pensando: "Oh, solo son hamburguesas", y predice que el tiempo de cocción será rápido. Pero como el menú cambió, el robot se equivoca.
La afirmación del artículo: Los modelos de IA actuales son "estáticos". Se entrenan una vez con datos antiguos y nunca se actualizan. Si los tipos de solicitudes cambian (por ejemplo, se añaden nuevos modelos de IA o cambia el número de pedidos), el modelo antiguo pierde precisión.

  • Resultado: El sistema sigue cometiendo malas suposiciones porque está utilizando un mapa desactualizado para un mundo cambiante.

Lo que hicieron los autores (El experimento)

Los autores montaron una cocina de prueba (usando una GPU NVIDIA) para ver qué tan graves son estos dos problemas.

  1. Probar el problema de la "instantánea": Realizaron simulaciones donde los lotes llegaban y se iban en diferentes momentos. Descubrieron que si ignoras estos cambios, tu predicción de cuánto tardará una tarea puede fallar por un margen enorme (a veces con un error de más del 60%). Es como adivinar que un viaje de 10 minutos tardará 16 minutos porque no sabías que un semáforo estaba a punto de ponerse en rojo.
  2. Probar el problema del "mapa viejo": Entrenaron un modelo con un conjunto de platos y luego intentaron predecir los tiempos para un conjunto de platos completamente diferente. El modelo antiguo falló estrepitosamente. Sin embargo, cuando dejaron que el modelo "aprendiera sobre la marcha" (Aprendizaje en línea / Online Learning) —actualizando sus predicciones a medida que veía nuevos datos—, mejoró mucho en el manejo de los cambios.

La conclusión

El artículo concluye que para ejecutar una cocina de IA eficiente sin entregas tardías, necesitamos dejar de usar programadores "torpes" que:

  1. Ignoran el hecho de que la multitud en la cocina cambia cada segundo.
  2. Se niegan a aprender de nuevos tipos de pedidos.

En su lugar, necesitamos un programador inteligente que:

  • Observe la cocina dinámicamente (rastreando quién llega y quién se va).
  • Aprenda y actualice sus predicciones en tiempo real a medida que la carga de trabajo cambia.

Al hacer esto, podemos mantener la GPU (la cocina) ocupada y eficiente, garantizando al mismo tiempo que cada pedido (cada solicitud de IA) reciba su respuesta a tiempo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →