← Últimos artigos
🤖 AI

Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

Este artigo apresenta um estudo empírico que revela que o agendamento de LLMs multi-modelo em hardware heterogêneo enfrenta degradação de desempenho significativa e dependente do modelo devido à transferência CPU-GPU e sobrecarga substancial de preempção impulsionada por recargas de estado, identificando assim fatores críticos para o projeto de agendadores eficientes de próxima geração.

Autores originais: Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

Publicado 2026-05-20
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você gerencia uma cozinha movimentada (um servidor de computador) com alguns chefs super-rápidos (GPUs) e um assistente de despensa mais lento, mas muito espaçoso (a CPU). Seu objetivo é cozinhar muitos tipos diferentes de pratos complexos (Modelos de Linguagem Grandes ou LLMs) ao mesmo tempo. Às vezes, a cozinha fica tão lotada que os chefs rápidos ficam sem espaço no balcão, então você precisa pedir ao assistente da despensa para ajudar a segurar alguns ingredientes ou até mesmo fazer parte do corte.

Este artigo é como um estudo detalhado do que acontece quando você tenta dividir o trabalho de cozinhar entre os chefs rápidos e o assistente lento, ou quando precisa parar repentinamente um prato para cozinhar um mais urgente.

Aqui estão as principais descobertas do estudo, explicadas de forma simples:

1. O Problema do "Meio-Chef" (Offloading)

Quando um prato é grande demais para o balcão do chef, você move algumas etapas da receita para o assistente da despensa.

  • A Descoberta: Não é uma troca suave. Se você mover apenas um pouco do trabalho para o assistente lento, a velocidade de cozimento não cai um pouco; ela cai drasticamente.
  • A Analogia: Pense como em uma corrida de revezamento. Se o corredor rápido (GPU) tiver que passar o bastão para um caminhante lento (CPU) mesmo por uma parte minúscula da corrida, toda a equipe fica dramaticamente mais lenta.
  • A Surpresa: Pratos pequenos (modelos de IA menores) sofrem mais. Se você tentar offloadar até mesmo uma pequena parte de um modelo pequeno, ele fica muito lento. Pratos maiores (modelos maiores) lidam melhor com a divisão, desacelerando de forma mais gradual.
  • A Lição: Você não pode apenas adivinhar quanto trabalho dar à CPU. Você precisa saber exatamente qual "prato" está cozinhando, porque alguns modelos odeiam ser divididos mais do que outros.

2. O "Custo de Troca" (Preempção)

Às vezes, um cliente VIP pede um novo prato, e você precisa parar o chef atual, limpar a estação dele e começar o novo. Isso é chamado de "preempção".

  • A Descoberta: O tempo que leva para trocar de prato é quase o mesmo, seja você parar o prato atual após 1 minuto ou após 1 hora.
  • A Analogia: Imagine que você está pintando um mural gigante. Se você tiver que parar para deixar outra pessoa pintar, o tempo que leva para limpar seus pincéis e preparar os pincéis do novo pintor é o mesmo, quer você tenha pintado 3 metros ou 300 metros. O tempo que você passou pintando não importa; o tempo que leva para trocar é fixo.
  • A Grande Revelação: A maioria das pessoas pensava que o tempo gasto movendo as "anotações" (a memória do que já foi pintado, chamada de cache KV) era a parte lenta. O estudo descobriu que mover as anotações é na verdade instantâneo (menos de 1% do tempo). O verdadeiro desperdício de tempo é desempacotar as ferramentas do chef antigo e desempacotar as ferramentas do novo chef (carregar os pesos do modelo do disco rígido).
  • A Lição: Trocar tarefas é caro, mas o custo é previsível. Depende inteiramente de quão pesado é o "kit de ferramentas" (o tamanho do modelo), não de quanto tempo o trabalho já está rodando.

3. O "engarrafamento" (Movimentação de Dados)

Ao mover coisas entre o chef rápido e o assistente lento, eles precisam passar por um corredor (o cabo de dados).

  • A Descoberta: Mesmo quando as "anotações" (memória) ficam enormes porque o prato é muito longo, movê-las ainda é super rápido em comparação com desempacotar as ferramentas.
  • A Analogia: É como mover uma única folha de papel versus mover uma estante inteira. Mover a folha (as anotações) é tão rápido que mal conta. Mover a estante (as ferramentas do modelo) leva uma eternidade.
  • A Lição: Não se preocupe demais com o tamanho das "anotações" ao decidir trocar de tarefa. Preocupe-se com o tamanho da "estante".

4. A "Personalidade do Hardware"

O estudo testou dois tipos diferentes de cozinhas (duas GPUs diferentes).

  • A Descoberta: Uma cozinha era mais rápida para cozinhar, mas mais lenta para trocar de tarefas do que a outra.
  • A Analogia: Uma cozinha tem um chef super-rápido, mas um corredor estreito, tornando difícil trocar ferramentas rapidamente. A outra tem um chef ligeiramente mais lento, mas um corredor largo, facilitando as trocas.
  • A Lição: Você não pode usar uma regra "tamanho único". A melhor maneira de agendar tarefas depende exatamente de qual hardware você tem.

Resumo para o Futuro

Os autores concluem que a próxima geração de "Gerentes de Cozinha" (agendadores) precisa ser mais inteligente. Eles não devem apenas olhar para quantos pedidos estão na fila. Eles precisam saber:

  1. Qual é o modelo? (Alguns odeiam ser divididos).
  2. Qual é o tamanho do kit de ferramentas? (Isso determina quanto tempo uma troca leva).
  3. Que tipo de cozinha é esta? (Hardware diferente muda as regras).

Ao entender essas peculiaridades específicas, os gerentes podem parar de tentar forçar uma cunha quadrada em um buraco redondo e, em vez disso, criar um sistema que execute muitos modelos de IA diferentes de forma eficiente sem derrubar a cozinha.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →