← Últimos artigos
🤖 machine learning

TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference

TokenWeave é um sistema inovador que alcança sobreposição eficiente de computação e comunicação para inferência distribuída de LLMs em pequenos tamanhos de lote, fundindo a operação RMSNorm com a comunicação AllReduce usando recursos especializados de GPU, reduzindo assim a latência e aumentando a vazão mesmo quando o número de tokens por iteração é tão baixo quanto 1024.

Autores originais: Raja Gond, Nipun Kwatra, Ramachandran Ramjee

Publicado 2026-05-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Raja Gond, Nipun Kwatra, Ramachandran Ramjee

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está operando uma fábrica massiva e de alta velocidade (um Modelo de Linguagem de Grande Escala) que processa solicitações de clientes. Para tornar essa fábrica suficientemente rápida, você contratou uma equipe de 8 trabalhadores especialistas (GPUs) para trabalhar em conjunto. Eles estão conectados por um sistema de esteiras transportadoras super-rápidas (NVLink) para que possam compartilhar seu trabalho instantaneamente.

No entanto, há um problema: os trabalhadores gastam muito tempo esperando para conversar entre si.

Mesmo com as esteiras transportadoras super-rápidas, os trabalhadores precisam parar sua construção real (computação) para passar notas de um para o outro (comunicação). No artigo, os autores descobriram que, para modelos grandes, esse "tempo de conversa" consome cerca de 20% do tempo total. É como um chef parar para ligar para os outros chefs na cozinha apenas para perguntar: "Você tem o sal?" antes de poder cortar o próximo vegetal.

O Jeito Antigo: Desmontando as Coisas

Tentativas anteriores de resolver isso tentaram dividir o trabalho em pedaços minúsculos. A ideia era: "Enquanto o Trabalhador A passa uma nota para o Trabalhador B, o Trabalhador A pode começar a cortar o próximo vegetal."

Mas os autores descobriram que isso não funcionava bem para pedidos pequenos (que é o que acontece quando você faz uma pergunta curta a uma IA). Dividir um grande trabalho em pedaços minúsculos na verdade tornava os trabalhadores mais lentos, porque eles tinham que parar e começar tantas vezes. É como tentar correr uma corrida de revezamento onde você passa o bastão a cada 10 pés; o tempo gasto correndo é menor do que o tempo gasto parando para entregar o bastão!

A Nova Solução: TokenWeave

Os autores construíram um novo sistema chamado TokenWeave. Pense nele como um gerente inteligente que reorganiza o chão de fábrica para eliminar o tempo de espera. Aqui está como eles fizeram isso, usando três truques simples:

1. A "Divisão Inteligente" (A Rodovia de Duas Faixas)

Em vez de tentar dividir o trabalho em um milhão de pedaços minúsculos, o TokenWeave divide o pedido em apenas dois grandes blocos.

  • Bloco A começa a trabalhar na primeira metade do trabalho.
  • Bloco B começa a trabalhar na segunda metade.
  • A Magia: Enquanto o Bloco A está ocupado fazendo seus cálculos, o Bloco B está ocupado passando suas notas. Depois, eles trocam. O Bloco A passa notas enquanto o Bloco B faz cálculos.
  • Por que funciona: Os autores descobriram exatamente como dividir o trabalho para que os trabalhadores não fiquem "presos" esperando pela esteira transportadora. Eles chamam isso de "consciente de ondas", o que significa que eles garantem que os trabalhadores estejam sempre ocupados, assim como um sistema de semáforos bem sincronizado que mantém os carros em movimento sem parar.

2. O "Kernel Fundido" (A Ferramenta Tudo-em-Um)

Na fábrica antiga, os trabalhadores tinham que fazer duas coisas separadas:

  1. Passar as notas (Comunicação).
  2. Normalizar os dados (uma etapa matemática chamada RMSNorm).

Os autores perceberam que fazer essas duas etapas separadamente era desperdício. É como ter que caminhar até o armário de suprimentos para pegar um martelo, depois voltar para a bancada para cravar um prego, e depois voltar ao armário para pegar uma chave de fenda.

  • A Correção: Eles construíram uma nova "super-ferramenta" (um kernel fundido) que faz a passagem de notas e a etapa matemática ao mesmo tempo.
  • O Bônus: Essa super-ferramenta é tão eficiente que precisa apenas de uma fração mínima da energia da fábrica (apenas 2–8 trabalhadores de 132) para funcionar. Isso deixa o restante dos trabalhadores livres para se concentrar inteiramente no trabalho pesado (computação).

3. A "Reordenação Inteligente" (Fazendo na Ordem Correta)

Normalmente, a fábrica passa todas as notas primeiro, depois faz os cálculos. Mas os autores perceberam que a etapa matemática (RMSNorm) poderia ser feita durante o processo de passagem de notas, se eles reorganizassem as etapas.

  • A Analogia: Em vez de esperar que todo o caminhão chegue antes de começar a descarregar, você começa a descarregar a primeira caixa assim que o caminhão chega. O TokenWeave reorganiza as etapas para que os cálculos aconteçam enquanto os dados ainda estão se movendo, economizando uma quantidade massiva de tempo.

Os Resultados

O artigo testou esse novo sistema em computadores poderosos (8x GPUs H100) com modelos do mundo real como Llama e Qwen.

  • Velocidade: Eles descobriram que o TokenWeave tornou a fábrica 1,28 vezes mais rápida (um aumento de velocidade de 28%) em comparação com os melhores sistemas existentes.
  • Pedidos Pequenos: Mesmo para perguntas muito curtas (apenas 1.000 palavras), foi 1,2 vezes mais rápido. Sistemas anteriores na verdade ficaram mais lentos com pedidos pequenos.
  • Taxa de Transferência: A fábrica pôde atender 19% mais clientes por hora.
  • A Alegação "Mágica": Em alguns casos, o TokenWeave foi tão eficiente que performou melhor do que uma versão teórica da fábrica que tinha zero comunicação. Isso porque sua nova "super-ferramenta" corrigiu a etapa matemática tão bem que compensou o tempo gasto conversando.

Resumo

O TokenWeave é como um maestro mestre para uma orquestra. Em vez de deixar os músicos pararem para conversar entre si (o que atrasa a música), ele ensina-os a tocar suas partes enquanto o maestro passa as partituras simultaneamente. Ao dividir o trabalho em apenas dois blocos inteligentes e usar uma nova ferramenta "tudo-em-um", eles eliminaram o tempo de espera, tornando a inferência de IA significativamente mais rápida e eficiente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →