← Últimos artigos
🤖 AI

FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs

Este artigo apresenta o FlashMLA-ETAP, um novo framework que utiliza um Pipeline de Atenção de Transposição Eficiente para acelerar significativamente a inferência de Multi-Head Latent Attention em GPUs NVIDIA H20 ao otimizar operações WGMMA, alcançando acelerações substanciais sobre os métodos existentes enquanto mantém alta estabilidade numérica.

Autores originais: Pengcuo Dege, Qiuming Luo, Rui Mao, Chang Kong

Publicado 2026-06-03
📖 4 min de leitura☕ Leitura rápida

Autores originais: Pengcuo Dege, Qiuming Luo, Rui Mao, Chang Kong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ler um livro muito longo (o "contexto") para responder a uma única pergunta curta (a "consulta"). Isso é essencialmente o que um modelo de IA de grande escala, como o DeepSeek-R1, faz ao gerar texto: ele olha para tudo o que leu até agora para decidir qual palavra dizer a seguir.

O artigo apresenta um novo método chamado FlashMLA-ETAP, que é como ensinar a IA uma maneira mais inteligente de folhear as páginas desse livro, especificamente para um tipo de chip de computador chamado NVIDIA H20.

Aqui está a divisão do problema e da solução usando analogias do cotidiano:

O Problema: A Questão da "Prateleira Estranha"

Pense na GPU NVIDIA H20 como um bibliotecário trabalhando em uma biblioteca com uma regra específica: As prateleiras devem ter pelo menos 64 livros de largura para serem estáveis. Se você tentar colocar apenas 16 livros em uma prateleira, o bibliotecário tem que preencher o espaço vazio com livros falsos (padding/preenchimento) para que a prateleira não desabe. Isso desperdiça tempo e energia.

No mundo da IA, os "livros" são as cabeças de atenção (as partes do cérebro que focam em coisas diferentes). Ao executar o enorme modelo DeepSeek-R1 em um único servidor com 8 GPUs H20, o trabalho é dividido. Cada GPU acaba lidando com apenas 16 cabeças.

Como 16 é menos do que o 64 exigido, a GPU H20 tem que fazer muito "trabalho fictício" (padding) para satisfazer suas regras de hardware. É como forçar o bibliotecário a carregar 64 caixas vazias apenas para transportar 16 reais. Isso torna a IA lenta e ineficiente, especialmente quando o "livro" que ela está lendo é muito longo (contexto longo), mas a pergunta que ela está respondendo é muito curta (apenas uma palavra por vez).

A Solução: Virar o Livro de Lado (ETAP)

Os autores criaram uma técnica chamada ETAP (Efficient Transpose Attention Pipeline). Em vez de tentar forçar as 16 cabeças a caberem na regra da prateleira de 64 de largura, eles viram o problema de lado.

Imagine que, em vez de olhar para 16 cabeças ao longo de uma linha curta, você olhe para o comprimento do livro (que pode ter milhares de páginas) como a dimensão principal. Como o livro é muito longo, ele preenche facilmente o requisito de "64 de largura" da prateleira sem precisar de livros falsos.

Ao trocar as dimensões — tratando o longo histórico da conversa como a "largura" principal e a pergunta curta como a "altura" — a GPU H20 pode trabalhar em velocidade máxima sem perder tempo com o preenchimento vazio. É como perceber que, em vez de tentar encaixar 16 itens pequenos em uma caixa grande, você deve empilhá-los verticalmente onde há muito espaço.

Os Resultados: Mais Rápido e Mais Preciso

O artigo afirma que essa abordagem "de lado" faz uma grande diferença na GPU H20:

  1. Muito Mais Rápido: Em comprimentos de conversa longos (64.000 palavras), o FlashMLA-ETAP é 2,78 vezes mais rápido do que o melhor método anterior para este modelo específico (FlashMLA). Também é significativamente mais rápido do que outros métodos populares como FlashAttention-3 e FlashInfer.
  2. Mais Preciso: Geralmente, quando você tenta acelerar os cálculos de IA, pode perder um pouco de precisão (como arredondar números de forma muito agressiva). No entanto, este novo método é, na verdade, mais preciso que o FlashAttention-3, com uma taxa de erro (RMSE) muito menor. É como ler o livro mais rápido e entendê-lo melhor.

Por Que Isso Importa

A maioria das otimizações de IA é projetada para chips supercaros e de alto desempenho (como o H100). O H20 é um chip de "nível médio" — bom, mas não o mais poderoso. Este artigo mostra que, com o truque de software certo (ETAP), você pode fazer com que chips de nível médio tenham um desempenho muito melhor para tarefas específicas. É como encontrar uma maneira de fazer um sedan padrão dirigir tão eficientemente quanto um carro esportivo em um tipo específico de estrada, mudando a forma como você troca as marchas.

Em resumo: FlashMLA-ETAP é uma atualização de software que diz à GPU NVIDIA H20 para reorganizar a forma como ela lê longas conversas de IA, eliminando o esforço desperdiçado e fazendo com que a IA responda mais rápido e com mais precisão.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →