← Últimos artículos
💻 computer science

TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes

TEMPO introduce un despachador de equilibrio de carga de experto-paralelo consciente del makespan que modela los tiempos de ejecución de expertos no lineales a través de regímenes limitados por memoria y por cómputo para optimizar dinámicamente la distribución de tokens, logrando hasta un 15.5% de ganancias en el rendimiento y reducciones significativas en la latencia en escenarios de régimen mixto donde los métodos tradicionales basados en recuento lineal fallan.

Autores originales: Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song

Publicado 2026-08-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que diriges un servicio de entrega de pizzas masivo y de alta velocidad para una ciudad que nunca duerme. Tienes una flota de repartidores idénticos (las GPUs) y una cocina central con cientos de chefs especializados diferentes (los "expertos" en un modelo de IA). Cada vez que un cliente pide una pizza, el sistema tiene que decidir qué chefs trabajarán en ella y qué repartidor llevará la pizza terminada. En el mundo de la Inteligencia Artificial, específicamente con un tipo de modelo llamado "Mezcla de Expertos" (MoE), esto es exactamente lo que sucede. Estos modelos son como cerebros gigantes compuestos por miles de sub-cerebros más pequeños y especializados. Cuando la IA piensa, no utiliza todo su cerebro a la vez; elige a unos pocos expertos específicos para manejar el trabajo.

El gran desafío es mantener a todo el equipo moviéndose a la misma velocidad. Si un repartidor se queda atrapado con un pedido enorme y complicado mientras todos los demás están ociosos, toda la entrega se retrasa. El tiempo que toma completar un lote de pedidos está determinado por la persona más lenta del grupo. Durante años, la regla estándar para equilibrar esta carga de trabajo fue simple: "Simplemente divide el número de pedidos equitativamente". Si tienes 100 pedidos, dale 10 a cada uno de tus 10 repartidores. Esto parecía lógico, como repartir una pila de manzanas de forma igualitaria. Pero, ¿qué pasa si algunas manzanas son rocas pesadas y otras son plumas ligeras? ¿O si la cocina tiene una regla donde elegir a un nuevo chef toma un tiempo fijo, sin importar cuántas pizzas prepare? Las viejas reglas asumían que el tiempo siempre estaba directamente vinculado al número de pedidos. Esta investigación pregunta: ¿qué pasa si esa suposición es errónea?

Los investigadores detrás de este artículo, trabajando en KlingAI, descubrieron que la vieja regla de "contar los pedidos" es en realidad una trampa. Encontraron que en el hardware de IA moderno, el tiempo que toma procesar un experto no depende solo de cuántos tokens (palabras o fragmentos de datos) ve. Es una bestia de dos caras. A veces, el tiempo está dominado por el esfuerzo puro de cargar la "receta" del experto (pesos) desde el banco de memoria, lo cual toma un tiempo fijo independientemente de qué tan pequeño sea el pedido. Otras veces, una vez que la receta se ha cargado, el tiempo crece linealmente con el número de pedidos. Los métodos antiguos, que solo miraban el número de pedidos, estaban ignorando el costo oculto de cargar la receta. Estaban intentando equilibrar una pila de plumas y rocas contando las piezas, no pesándolas.

Para solucionar esto, el equipo construyó un despachador nuevo llamado TEMPO (Optimización de Paralelismo de Expertos Modelada por Tiempo). En lugar de solo contar tokens, TEMPO actúa como un inteligente controlador de tráfico que entiende la física de la cocina. Utiliza un "modelo de costo" especial que mide exactamente cuánto tiempo toma cargar la receta de un chef y cuánto tiempo toma cocinar la pizza. Se da cuenta de que si tienes un experto "frío" (uno que no ha sido usado en un tiempo), dividir su pequeño pedido entre dos repartidores es un desastre porque tienes que pagar la "tarifa de carga" dos veces. Pero si tienes un experto "caliente" con una montaña de pedidos, dividirlo está bien.

El artículo muestra que TEMPO no solo adivina; calcula el equilibrio perfecto para cada lote de solicitudes en milisegundos. Lo probaron en modelos de IA reales y encontraron que los métodos antiguos eran a menudo un 15% más lentos o causaban retrasos significativos para los últimos clientes en una fila. TEMPO, sin embargo, mantiene la línea moviéndose suavemente. Es como cambiar una regla que dice "todos reciben el mismo número de manzanas" por una que dice "todos reciben la misma cantidad de trabajo", teniendo en cuenta que algunas manzanas son pesadas y algunos chefs tardan en despertar.

Los investigadores fueron muy cuidadosos en mostrar exactamente dónde trabaja este nuevo método y dónde no. Demostraron que si los expertos "calientes" son tan numerosos que el sistema simplemente está abrumado por el volumen total de datos (el régimen "limitado por cómputo"), el método antiguo de contar tokens es en realidad adecuado. Pero en el mundo real, donde algunos expertos están ocupados y otros están descansando, y donde la "tarifa de carga" es alta, TEMPO brilla. Incluso mapearon un "diagrama de fases", que es como un mapa meteorológico para el tráfico de IA, prediciendo exactamente cuándo el nuevo método ahorrará tiempo y cuándo el método antiguo es lo suficientemente bueno.

Al final, este artículo no es solo sobre un algoritmo más rápido; es sobre cambiar la forma en que pensamos sobre el equilibrio del trabajo en la IA. Nos enseña que en el complejo y de alta velocidad mundo de la IA moderna, no puedes simplemente contar cosas. Tienes que entender los costos ocultos de mover datos y la forma específica del trabajo. Al medir el tiempo real que toma hacer el trabajo en lugar de solo contar los artículos, TEMPO hace que los modelos de IA sean más rápidos, más eficientes y estén listos para manejar las demandas masivas del futuro. Convierte una cocina caótica en una máquina bien aceitada, asegurando que ningún repartidor se quede esperando mientras la pizza reposa bajo la lámpara de calor.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →