← Últimos artigos
🤖 machine learning

Understanding and Improving Communication Performance in Multi-node LLM Inference

Este artigo apresenta um estudo de desempenho da inferência de LLMs em múltiplos nós que identifica as operações all-reduce como um gargalo fundamental e introduz o NVRAR, um algoritmo hierárquico all-reduce utilizando NVSHMEM que reduz significativamente a latência e melhora o desempenho de ponta a ponta para modelos grandes como o Llama 3.1 405B em comparação com implementações NCCL padrão.

Autores originais: Prajwal Singhania, Siddharth Singh, Lannie Dalton Hough, Akarsh Srivastava, Harshitha Menon, Charles Fredrick Jekel, Abhinav Bhatele

Publicado 2026-05-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Prajwal Singhania, Siddharth Singh, Lannie Dalton Hough, Akarsh Srivastava, Harshitha Menon, Charles Fredrick Jekel, Abhinav Bhatele

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando resolver um quebra-cabeça massivo e complexo. No mundo da Inteligência Artificial, esse quebra-cabeça é um "Modelo de Linguagem Grande" (LLM)—um cérebro de computador superinteligente que pode escrever histórias, responder perguntas e resolver problemas. À medida que esses cérebros ficam maiores e mais inteligentes, tornam-se pesados demais para serem mantidos por um único computador.

Para resolver isso, os cientistas dividem as peças do quebra-cabeça entre muitos computadores (chamados de "nós") trabalhando juntos. Este artigo trata de descobrir como fazer esses computadores se comunicarem de forma eficiente, para que não percam tempo esperando.

Aqui está uma explicação simples do que os pesquisadores descobriram e construíram:

1. O Problema: O Gargalo do "Jogo do Telefone"

Quando computadores trabalham juntos, precisam compartilhar informações constantemente.

  • A Configuração: Imagine uma equipe de 32 pessoas (GPUs) tentando resolver o quebra-cabeça. Elas são divididas em grupos (nós). Dentro de um grupo, podem gritar umas para as outras instantaneamente (como usando um walkie-talkie interno super-rápido chamado NVLink). Mas para falar com os outros grupos, precisam usar uma linha telefônica mais lenta e de longa distância (a rede entre nós).
  • A Questão: Os pesquisadores descobriram que, quando os computadores tentam resolver a parte de "decodificação" do quebra-cabeça (gerando uma palavra de cada vez), precisam enviar mensagens muito pequenas uns para os outros.
  • A Analogia: Imagine que você está em uma corrida de revezamento. Se você tiver que correr uma longa distância para passar um bilhete minúsculo para o próximo corredor, e a pessoa para quem você está passando for lenta em receber bilhetes, você passará a maior parte do tempo esperando. O artigo descobriu que o software padrão de "linha telefônica" (chamado NCCL) era terrível ao lidar com essas notas pequenas e frequentes entre diferentes edifícios (nós). Era como tentar enviar um cartão postal por um serviço postal lento quando você precisava passar um aperto de mão secreto instantaneamente.

2. A Comparação: Duas Maneiras de Organizar a Equipe

Os pesquisadores testaram duas maneiras principais de organizar a equipe:

  • Paralelismo Tensorial (TP): Todos trabalham na mesma parte do quebra-cabeça ao mesmo tempo, mas precisam verificar constantemente com todos os outros para garantir que concordam. Isso é ótimo para grandes blocos de trabalho, mas fica atolado por todas essas verificações (comunicação).
  • Paralelismo Híbrido (HP): Eles dividem o quebra-cabeça em grandes pedaços e atribuem pedaços diferentes a pessoas diferentes. Isso reduz a necessidade de verificar, mas não é tão eficiente para a parte de geração "palavra por palavra" da tarefa.

A Descoberta: Para a parte de "palavra por palavra" da tarefa (que é o que acontece na maior parte do tempo), o TP geralmente é melhor, mas apenas se a equipe puder falar entre si com rapidez suficiente. A maneira padrão de falar era muito lenta, fazendo a equipe parar.

3. A Solução: NVRAR (A "Pista Expressa")

Para corrigir a comunicação lenta, os pesquisadores construíram uma nova ferramenta chamada NVRAR.

  • Como funciona: Em vez de usar o serviço postal padrão e lento, eles construíram uma "Pista Expressa" personalizada usando uma tecnologia chamada NVSHMEM.
  • A Analogia: Pense na maneira antiga como enviar uma carta que precisa ser carimbada, classificada e entregue por um caminhão. O NVRAR é como ter um drone dedicado que voa diretamente de uma pessoa para outra, deixando cair a nota e pegando uma resposta no mesmo instante.
  • O Truque de "Duplicação Recursiva": Eles organizaram a comunicação como um jogo de "telefone" onde todos dobram o número de pessoas com quem falam a cada etapa. Em vez de todos falarem com todos um por um, eles formam pares, fundem, formam pares novamente e fundem novamente. Isso é muito mais rápido para grandes grupos.

4. Os Resultados: Acelerando a Equipe

Quando conectaram essa nova "Pista Expressa" (NVRAR) ao seu sistema:

  • Falar Mais Rápido: Para as mensagens pequenas usadas nessas tarefas de IA, o novo sistema foi 1,9 a 3,6 vezes mais rápido que o sistema padrão.
  • Melhor Resolução de Quebra-Cabeça: Quando usaram esse novo sistema para executar o massivo modelo "Llama 3.1 405B" (um cérebro de IA gigante), o tempo necessário para gerar respostas caiu significativamente. Em alguns casos, a equipe terminou 1,72 vezes mais rápido do que antes.
  • Teste do Mundo Real: Eles testaram isso em tráfego do mundo real (simulando milhares de usuários fazendo perguntas) e descobriram que o sistema podia lidar com mais solicitações por segundo sem desacelerar.

Resumo

O artigo trata essencialmente de perceber que, quando uma enorme equipe de computadores tenta resolver um quebra-cabeça de IA, o maior atraso não é o pensamento—é a conversa. A maneira padrão de falar entre diferentes edifícios era muito lenta para as mensagens pequenas e frequentes necessárias. Os autores construíram um sistema de comunicação personalizado e de alta velocidade (NVRAR) que atua como uma pista expressa, permitindo que a equipe se coordene instantaneamente e resolva o quebra-cabeça muito mais rápido.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →