← Últimos artigos
🤖 machine learning

Requests of a Feather Must Flock Together: Batch Size vs. Prefix Homogeneity in LLM Inference

Este artigo apresenta o Feather, um agendador consciente de prefixos baseado em aprendizado por reforço que otimiza o trade-off entre tamanho de lote e homogeneidade de prefixos usando uma Árvore de Hash Fragmentada leve, alcançando 2 a 10 vezes mais throughput de inferência de LLM ao reduzir a sobrecarga de acesso ao cache KV em comparação com agendadores existentes de última geração.

Autores originais: Saksham Rathi, Preeti, Mythili Vutukuru

Publicado 2026-05-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Saksham Rathi, Preeti, Mythili Vutukuru

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está gerenciando uma biblioteca muito movimentada e de alta velocidade, onde um único bibliotecário (a GPU) tenta responder a milhares de perguntas de pessoas diferentes (requisições) ao mesmo tempo.

No mundo dos Modelos de Linguagem Grandes (LLMs), o bibliotecário precisa ler um livro massivo de "contexto" (o cache de Chave-Valor) para cada palavra que gera. O artigo argumenta que a maneira atual de organizar essas perguntas é ineficiente porque foca demais em quantas perguntas o bibliotecário responde de uma vez, em vez de quão semelhantes são essas perguntas.

Aqui está a história de sua solução, Feather, desdobrada em conceitos simples:

1. O Problema: O "Ônibus Lotado" vs. O "Grupo Familiar"

Atualmente, a maioria dos sistemas tenta colocar o maior número possível de pessoas em um ônibus (um "lote") para tornar a viagem eficiente. Eles usam uma regra de "Primeiro a Chegar, Primeiro a Ser Atendido".

  • O Problema: Se você colocar 500 estranhos em um ônibus, todos querem ir para 500 lugares diferentes. O motorista precisa parar em 500 paradas diferentes, mudando constantemente de direção. Isso é caótico e lento.
  • A Descoberta: Os autores descobriram que, se você pegar um grupo menor de 100 pessoas que moram todas na mesma rua (compartilham um "prefixo"), o motorista pode dirigir diretamente por aquela rua sem parar. Mesmo que o ônibus não esteja cheio, a viagem é muito mais rápida porque o motorista não precisa ficar virando o volante.

A Chave da Descoberta: É melhor ter um grupo menor de pessoas indo para o mesmo lugar do que um grupo enorme de pessoas indo para lugares diferentes. Isso é chamado de Homogeneidade de Prefixo.

2. O Jeito Antigo: O "Escalador de Árvores"

Sistemas existentes (como o SGLang) tentam encontrar esses grupos olhando para uma árvore familiar gigante e complexa (uma Árvore Radix) para ver quem compartilha os mesmos ancestrais.

  • O Problema: Escalar essa árvore para encontrar correspondências consome muito tempo e energia no "cérebro" do computador (a CPU). Na verdade, o tempo gasto escalando a árvore às vezes era quase tão longo quanto o tempo que o bibliotecário gastava realmente respondendo às perguntas! Era como gastar 10 minutos organizando os passageiros apenas para dirigir por 10 minutos.

3. A Solução: "Feather"

Os autores criaram um novo agendador chamado Feather que corrige ambos os problemas.

Parte A: A "Árvore de Hash em Blocos" (CHT) – A Lista de Verificação Inteligente

Em vez de escalar a árvore familiar gigante, o Feather usa um atalho inteligente.

  • A Analogia: Imagine que, em vez de verificar cada letra do nome de uma pessoa, você verifica apenas os primeiros "blocos" do endereço dela.
  • Como funciona: O Feather divide o texto longo em pequenos blocos (chunks) e dá a cada bloco uma "impressão digital" única (um hash). Ele mantém uma lista simples de quais impressões digitais estão sendo usadas atualmente.
  • O Benefício: Ele pode ver instantaneamente: "Ah, esta nova requisição tem as mesmas impressões digitais que o grupo já no ônibus". Ele faz isso tão rápido que o "cérebro da CPU" mal suava. É como usar um leitor de código de barras em vez de ler um livro inteiro para verificar um ingresso.

Parte B: O "Aprendizado por Reforço" (RL) – O Despachante Inteligente

O Feather não apenas encontra grupos semelhantes; ele aprende quando parar de adicionar pessoas ao ônibus.

  • O Dilema: Se você continuar adicionando pessoas ao ônibus, eventualmente poderá ter que adicionar alguém que mora em uma rua diferente. Se você os adicionar, todo o grupo fica bagunçado e a velocidade cai.
  • O Aprendizado: O Feather age como um despachante inteligente que aprendeu através de tentativa e erro: "Se eu adicionar mais uma pessoa, podemos perder nossa velocidade. Vamos enviar este ônibus agora enquanto ainda está rápido e esperar pelo próximo grupo."
  • O Resultado: Ele decide dinamicamente o momento perfeito para lançar o lote, equilibrando entre ter um ônibus cheio e manter todos na mesma rua.

4. Os Resultados: Acelerando a Biblioteca

Quando os autores testaram o Feather:

  • Velocidade: Tornou o sistema 2 a 10 vezes mais rápido do que os melhores métodos atuais quando as pessoas faziam perguntas semelhantes.
  • Segurança: Se as perguntas fossem todas totalmente diferentes (sem ruas compartilhadas), o Feather não se confundiu; ele apenas performou tão bem quanto os métodos antigos.
  • Eficiência: Reduziu os "engarrafamentos" na memória do computador, significando que o bibliotecário não precisava correr de um lado para o outro tantas vezes para buscar as páginas do livro.

Resumo

Feather é uma nova maneira de organizar requisições de IA. Em vez de enfiar o maior número possível de requisições em um único lote, ele agrupa requisições semelhantes (como uma família indo para o mesmo destino) e usa um método super-rápido e de baixo consumo de energia para encontrar esses grupos. Ele aprende exatamente quando parar de adicionar pessoas ao grupo para manter a viagem suave e rápida.

O artigo afirma que essa abordagem acelera significativamente os tempos de resposta de IA sem precisar de hardware novo e caro, simplesmente organizando o "tráfego" de forma mais inteligente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →