← Últimos artigos
🤖 machine learning

ML Inference Scheduling with Predictable Latency

Este artigo identifica limitações críticas nas abordagens existentes de escalonamento de inferência de ML, especificamente sua previsão de interferência de granularidade grossa e dependência de modelos estáticos, o que leva a previsões de latência imprecisas e SLOs comprometidos sob cargas de trabalho dinâmicas.

Autores originais: Haidong Zhao, Nikolaos Georgantas

Publicado 2026-06-16
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Haidong Zhao, Nikolaos Georgantas

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: A Cozinha de um Restaurante Movimentado

Imagine a cozinha de um restaurante de luxo (a GPU) que é incrivelmente rápida, mas muito cara para operar. Para economizar dinheiro, o proprietário quer cozinhar o máximo de refeições possível ao mesmo tempo (melhorar a utilização).

Nesta cozinha, chegam pedidos de diferentes pratos (como modelos de Machine Learning). Para serem eficientes, os chefs agrupam pedidos semelhantes em um único "lote" (batch) para cozinhá-los todos de uma vez. Por exemplo, em vez de cozinhar um hambúrguer, depois duas porções de batata frita, depois outro hambúrguer, eles cozinham uma bandeja com cinco hambúrgueres ao mesmo tempo.

No entanto, a cozinha tem um problema: Interferência.
Se o chef tentar cozinhar uma bandeja enorme de hambúrgueres e uma bandeja de suflês delicados exatamente ao mesmo tempo no mesmo fogão, eles podem atrapalhar um ao outro. O calor pode ficar irregular ou o chef pode ter que trocar de utensílios com muita frequência. Isso atrasa tudo, fazendo com que a comida chegue atrasada.

No mundo da IA, "comida atrasada" significa latência. Se um carro autônomo ou uma chamada de vídeo receber uma resposta atrasada porque a cozinha estava muito cheia, isso é uma falha. O objetivo deste artigo é descobrir como agendar esses lotes de cozimento para que a cozinha permaneça ocupada sem fazer a comida chegar atrasada.

O Problema: Adivinhar é Perigoso

O artigo argumenta que os métodos atuais para prever quanta "aglomeração" (interferência) ocorrerá são falhos de duas maneiras principais:

1. O Problema da "Foto Estática" (Granularidade Grossa)

A Analogia: Imagine que você é um controlador de tráfego. Você olha para um mapa e vê um caminhão vermelho e um carro azul na rodovia no momento atual. Você prevê que eles dirigirão lado a lado durante toda a viagem.
A Realidade: Na cozinha, o caminhão vermelho (Lote 1) pode sair da rodovia após 10 segundos, e um caminhão de grande porte (Lote 3) pode entrar e permanecer por 5 minutos.
A Alegação do Artigo: Os agendadores de IA atuais são como esse controlador de tráf-ego. Eles olham para quem está na cozinha agora e assumem que permanecerão assim. Eles ignoram o fato de que os lotes chegam e saem em tempos diferentes.

  • Resultado: A previsão está errada. O sistema pensa que a cozinha estará calma, mas de repente chega um novo lote pesado, causando um congestionamento e entregas atrasadas.

2. O Problema do "Mapa Antigo" (Modelos Não Adaptativos/Estáticos)

A Analogia: Imagine que você treinou um robô chef para prever tempos de cozimento usando um cardápio do ano passado. No ano passado, todos pediam hambúrgueres. Este ano, todos estão pedindo frutos do mar complexos.
A Realidade: O robô chef ainda pensa: "Ah, são apenas hambúrgueres", e prevê que o tempo de cozimento será rápido. Mas, como o cardápio mudou, o robô está errado.
A Alegação do Artigo: Os modelos de IA atuais são "estáticos". Eles são treinados uma única vez com dados antigos e nunca são atualizados. Se os tipos de solicitações mudarem (por exemplo, novos modelos de IA são adicionados ou o número de pedidos muda), o modelo antigo torna-se impreciso.

  • Resultado: O sistema continua fazendo previsões ruins porque está usando um mapa desatualizado para um mundo em constante mudança.

O Que os Autores Fizeram (O Experimento)

Os autores montaram uma cozinha de teste (usando uma GPU NVIDIA) para ver o quão graves esses dois problemas realmente são.

  1. Testando o problema da "Foto": Eles realizaram simulações onde os lotes chegavam e saíam em tempos diferentes. Descobriram que, se você ignorar essas mudanças, sua previsão de quanto tempo uma tarefa levará pode estar errada por uma margem enorme (às vezes com mais de 60% de erro). É como prever que uma viagem de 10 minutos levará 16 minutos porque você não sabia que um semáforo estava prestes a ficar vermelho.
  2. Testando o problema do "Mapa Antigo": Eles treinaram um modelo com um conjunto de pratos e tentaram prever tempos para um conjunto de pratos completamente diferente. O modelo antigo falhou miseravelmente. No entanto, quando deixaram o modelo "aprender sobre o voo" (Aprendizado Online — atualizando suas previsões conforme via novos dados), ele melhorou muito ao lidar com as mudanças.

A Conclusão

O artigo conclui que, para operar uma cozinha de IA eficiente sem entregas atrasadas, precisamos parar de usar agendadores "burros" que:

  1. Ignoram o fato de que a multidão na cozinha muda a cada segundo.
  2. Recusam-se a aprender com novos tipos de pedidos.

Em vez disso, precisamos de um agendador inteligente que:

  • Observe a cozinha dinamicamente (rastreando quem chega e quem sai).
  • Aprenda e atualize suas previsões em tempo real conforme a carga de trabalho muda.

Ao fazer isso, podemos manter a GPU (a cozinha) ocupada e eficiente, garantindo ao mesmo tempo que cada pedido (cada solicitação de IA) receba sua resposta no prazo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →