← Últimos artigos
💻 computer science

TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes

O TEMPO introduz um despachante de balanceamento de carga de paralelismo de especialistas consciente do makespan que modela tempos de execução de especialistas não lineares através de regimes limitados por memória e computação para otimizar dinamicamente a distribuição de tokens, alcançando ganhos de até 15,5% no throughput e reduções significativas de latência em cenários de regime misto onde métodos tradicionais baseados em contagem linear falham.

Autores originais: Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song

Publicado 2026-08-14
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando um serviço de entrega de pizza massivo e de alta velocidade para uma cidade que nunca dorme. Você tem uma frota de motoristas de entrega idênticos (as GPUs) e uma cozinha central com centenas de chefs especializados diferentes (os "especialistas" de um modelo de IA). Toda vez que um cliente faz um pedido de pizza, o sistema tem que decidir quais chefs trabalharão nela e qual motorista levará a torta pronta. No mundo da Inteligência Artificial, especificamente com um tipo de modelo chamado "Mixture-of-Experts" (MoE), é exatamente isso que acontece. Esses modelos de IA são como cérebros gigantes feitos de milhares de subcérebros menores e especializados. Quando a IA pensa, ela não usa todo o seu cérebro de uma vez; ela escolhe alguns especialistas específicos para lidar com o trabalho.

O grande desafio é manter toda a equipe se movendo na mesma velocidade. Se um motorista ficar preso com um pedido enorme e complicado enquanto todos os outros estão ociosos, toda a entrega será atrasada. O tempo que leva para concluir um lote de pedidos é determinado pela pessoa mais lenta do grupo. Durante anos, a regra padrão para equilibrar essa carga de trabalho foi simples: "Apenas divida o número de pedidos igualmente". Se você tem 100 pedidos, dê 10 para cada um de seus 10 motoristas. Isso parecia lógico, como compartilhar uma pilha de maçãs igualmente. Mas e se algumas maçãs forem pedras pesadas e outras penas leves? Ou se a cozinha tiver uma regra onde escolher um novo chef leva um tempo fixo, não importa quantas pizzas eles façam? As regras antigas assumiam que o tempo estava sempre diretamente ligado ao número de pedidos. O antigo método assumia que o tempo era sempre diretamente proporcional ao número de pedidos. Este artigo pergunta: e se essa suposição estiver errada?

Os pesquisadores por trás deste artigo, trabalhando na KlingAI, descobriram que a antiga regra de "contar os pedidos" é, na verdade, uma armadilha. Eles descobriram que, no hardware de IA moderno, o tempo necessário para processar um especialista não depende apenas de quantos tokens (palavras ou blocos de dados) ele vê. É uma fera de duas faces. Às vezes, o tempo é dominado pelo esforço puro de carregar a "receita" do especialista (pesos) da memória, o que leva um tempo fixo, independentemente de quão pequeno seja o pedido. Outras vezes, uma vez que a receita é carregada, o tempo cresce linearmente com o número de pedidos. Os métodos antigos, que olhavam apenas para o número de pedidos, estavam ignorando o custo oculto de carregar a receita. Eles estavam tentando equilibrar uma pilha de penas e pedras contando-as, em vez de pesá-las.

Para corrigir isso, a equipe construiu um novo despachante chamado TEMPO (Time-modeled Expert-Parallel Optimization). Em vez de apenas contar tokens, o TEMPO age como um controlador de tráfego inteligente que entende a física da cozinha. Ele usa um "modelo de custo" especial que mede exatamente quanto tempo leva para carregar a receita de um chef e quanto tempo leva para cozinhar a pizza. Ele percebe que, se você tem um especialista "frio" (um que não é usado há algum tempo), dividir seu pequeno pedido entre dois motoristas é um desastre porque você tem que pagar a "taxa de carregamento" duas vezes. Mas se você tem um especialista "quente" com uma montanha de pedidos, dividir é aceitável.

O artigo mostra que o TEMPO não apenas adivinha; ele calcula o equilíbrio perfeito para cada lote de pedidos em milissegundos. Eles testaram isso em modelos de IA reais e descobriram que os métodos antigos eram frequentemente 15% mais lentos ou causavam atrasos significativos para os últimos clientes de uma fila. O TEMPO, no entanto, mantém a linha fluindo suavemente. É como mudar de uma regra que diz "todos recebem o mesmo número de maçãs" para uma regra que diz "todos recebem a mesma quantidade de trabalho", levando em conta que algumas maçãs são pesadas e alguns chefs demoram a acordar.

Os pesquisadores foram muito cuidadosos para mostrar exatamente onde este novo método funciona e onde ele não funciona. Eles provaram que, se os especialistas "quentes" forem tão numerosos que o sistema é apenas sobrecarregado pelo volume puro de dados (o regime "compute-bound"), o antigo método de contagem de tokens é, na verdade, adequado. Mas no mundo real, onde alguns especialistas estão ocupados e outros estão descansando, e onde a "taxa de carregamento" é alta, o TEMPO brilha. Eles até mapearam um "diagrama de fase", que é como um mapa meteorológico para o tráfego de IA, prevendo exatamente quando o novo método economizará tempo e quando o método antigo é bom o suficiente.

No fim, este artigo não é apenas sobre um algoritmo mais rápido; é sobre mudar a forma como pensamos sobre o equilíbrio de trabalho na IA. Ele nos ensina que, no complexo e veloz mundo da IA moderna, você não pode apenas contar coisas. Você tem que entender os custos ocultos de mover dados e a forma específica do trabalho. Ao medir o tempo real para realizar o trabalho, em vez de apenas contar os itens, o TEMPO torna os modelos de IA mais rápidos, mais eficientes e prontos para lidar com as demandas massivas do futuro. Ele transforma uma cozinha caótica em uma máquina bem lubrificada, garantindo que nenhum motorista fique esperando enquanto a pizza fica sob a lâmpada de calor.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →