← Últimos artigos
💻 computer science

TACO: Efficient Communication Compression of Intermediate Tensors for Scalable Tensor-Parallel LLM Training

TACO é um framework robusto baseado em FP8 que emprega quantização adaptativa e um operador de compressão fundido para comprimir eficientemente tensores intermediários no treinamento de LLMs com paralelismo de tensores, alcançando até 1,87x de melhoria no throughput enquanto mantém precisão quase sem perdas.

Autores originais: Man Liu, Xingchen Liu, Xingjian Tian, Bing Lu, Shengkay Lyu, Shengquan Yin, Wenjing Huang, Zheng Wei, Hairui Zhao, Guangming Tan, Dingwen Tao

Publicado 2026-04-28
📖 4 min de leitura☕ Leitura rápida

Autores originais: Man Liu, Xingchen Liu, Xingjian Tian, Bing Lu, Shengkay Lyu, Shengquan Yin, Wenjing Huang, Zheng Wei, Hairui Zhao, Guangming Tan, Dingwen Tao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar uma equipe gigante de robôs (um Modelo de Linguagem de Grande Escala) a escrever uma história. Para fazer isso, você divide o trabalho entre centenas de robôs trabalhando em paralelo. Isso é chamado de Paralelismo de Tensores.

No entanto, há um problema grave: esses robôs precisam constantemente sussurrar seu progresso uns para os outros. Eles trocam bilhetes de volta e para frente milhares de vezes por segundo. O problema é que esses bilhetes são enormes, e o corredor que usam para passá-los (a rede) é estreito e lento. Os robôs passam mais tempo esperando pelos bilhetes do que realmente escrevendo a história.

TACO é um novo sistema projetado para encolher esses bilhetes para que os robôs possam falar mais rápido sem perder o significado da história.

Veja como o TACO funciona, explicado através de analogias simples:

1. O Problema: A Multidão de "Zeros"

Os bilhetes que os robôs passam (chamados de tensores intermediários) têm uma forma estranha. A maioria dos números neles são números minúsculos, minúsculos, agrupados bem perto de zero. Alguns são enormes, mas são raros.

  • O Jeito Antigo (INT8): Imagine tentar descrever uma multidão onde 99% das pessoas estão paradas em um círculo minúsculo e 1% está correndo para longe. Se você usar uma régua padrão (INT8) que tem espaçamento igual para cada polegada, você não consegue medir o círculo minúsculo com precisão. Todos no círculo são espremidos no mesmo lugar, e a informação é perdida. Os robôs ficam confusos e o treinamento falha.
  • A Solução TACO (FP8): O TACO usa uma régua especial (FP8) que tem marcações muito finas e minúsculas perto de zero e marcações mais largas longe dali. Isso é perfeito para a "multidão de zeros". Mas até essa régua tem limites.

2. O Truque de Mágica: O "Embaralhamento Adaptativo" (Transformação ASH)

Mesmo com a régua especial FP8, os bilhetes ainda estão muito aglomerados perto de zero. O TACO realiza um truque de mágica inteligente chamado Transformação de Escala Adaptativa–Hadamard.

  • A Analogia: Imagine uma sala cheia de pessoas aglomeradas apertadas em um canto (os valores zero). Se você apenas pedir que elas se alinhem, elas ainda estarão muito próximas para serem contadas com precisão.
  • O que o TACO faz: Primeiro, ele mede o quão "energético" cada pequeno grupo de pessoas é. Em seguida, ele empurra gentilmente os grupos silenciosos (valores baixos) para separá-los, tornando-os mais fáceis de ver, enquanto puxa os grupos barulhentos (valores altos) para mais perto, para que não saiam da borda da sala.
  • O Resultado: A multidão agora está espalhada perfeitamente pela sala, cabendo exatamente no "ponto ideal" da régua FP8. Isso previne o "Colapso de Zero", onde a informação é perdida.

3. A Rede de Segurança: "Escala Dupla" (DS)

Às vezes, mesmo após embaralhar, alguns números podem ficar grandes demais para a régua FP8, ou pequenos demais.

  • A Analogia: Imagine que você está fazendo uma mala. Você tem uma balança principal para as roupas pesadas, mas também precisa de uma balança minúscula para as joias.
  • O que o TACO faz: Ele usa duas balanças ao mesmo tempo. Uma balança ajusta todo o grupo para caber na mala (prevenindo o transbordamento), e a outra balança garante que as joias minúsculas (os valores pequenos) não sejam esmagadas. Isso mantém o treinamento estável e impede que os robôs fiquem "divergentes" (saiam dos trilhos).

4. O Impulso de Velocidade: "A Cozinha de Fusão"

Geralmente, para encolher esses bilhetes, o computador precisa realizar três etapas separadas: medir a multidão, embaralhá-los e depois embalá-los. Isso é como um chef picar, depois mexer e depois servir, mas tendo que caminhar até a geladeira entre cada etapa. É lento.

  • Inovação do TACO: O TACO constrói uma "cozinha de fusão". Ele combina picar, mexer e servir em um único movimento super-rápido. O computador realiza as três etapas de uma vez, sem parar para escrever dados na memória. Isso torna o processo incrivelmente rápido e permite que os robôs falem enquanto ainda estão pensando (sobrepondo comunicação com computação).

Os Resultados

O artigo testou o TACO em modelos gigantes (como GPT e Qwen) e descobriu:

  • Velocidade: Tornou o treinamento 1,87 vezes mais rápido em alguns casos.
  • Precisão: Apesar de encolher os dados tanto, os robôs aprenderam tão bem quanto se tivessem enviado os bilhetes completos e não comprimidos. A "perda" (erro) foi quase inexistente.
  • Escalabilidade: Funciona muito bem mesmo quando você tem 8, 16 ou mais robôs trabalhando juntos.

Em resumo: O TACO é uma maneira inteligente e rápida de reduzir o tráfego massivo de dados entre os robôs de treinamento de IA. Ele usa um truque especial de "reembaralhamento" para fazer os dados caberem perfeitamente em um formato menor, garantindo que a IA aprenda rapidamente sem perder a cabeça.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →