← Últimos artigos
🤖 machine learning

Hardware-Aware FP4 FlashAttention-4

Este artigo introduz o Hardware-Aware FP4 FlashAttention-4, um método que supera as limitações dos tensor cores FP4 da Blackwell ao empregar Direct-P para inferência não causal e um caminho causal com gradientes FP8, alcançando até 2,13× mais velocidade de throughput de forward e 1,14× mais velocidade de atualizações de treinamento em GPU única, enquanto evita os problemas de divergência observados no treinamento MXFP4.

Autores originais: Robert Hu

Publicado 2026-09-04✓ Author reviewed
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Robert Hu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo da inteligência artificial, os modelos mais poderosos dependem de um mecanismo chamado "atenção" para compreender o contexto. Imagine um leitor examinando um documento longo; a atenção permite que o modelo foque nas palavras mais relevantes em uma frase enquanto ignora o restante, conectando ideias através de vastas distâncias. Para fazer isso, o computador realiza uma série massiva de cálculos, comparando cada palavra com todas as outras para determinar suas relações. Durante anos, esses cálculos foram realizados com números de alta precisão, semelhante ao uso de uma régua com marcações minúsculas e precisas para medir um edifício. Isso garante que o modelo aprenda corretamente, mas é lento e consome enormes quantidades de energia. À medida que os modelos crescem, a necessidade de velocidade torna-se crítica. Pesquisadores desenvolveram recentemente chips capazes de usar números muito menores e mais grosseiros — valores de ponto flutuante de quatro bits — para realizar essas comparações muito mais rápido. No entanto, simplesmente mudar para esses números menores não é suficiente; o software que gerencia o fluxo de dados também deve mudar, ou os ganhos de velocidade desaparecem.

Um pesquisador da Graphcore abordou esse gargalo específico com um novo método que eles chamam de Direct-P. O trabalho deles foca na passagem "forward" (direta) da atenção, onde o modelo processa informações para gerar uma resposta, e na passagem "backward" (reversa), onde ele aprende com seus erros. O pesquisador descobriu que, embora os novos chips possam multiplicar números incrivelmente rápido, a etapa intermediária — converter pontuações brutas em probabilidades — estava atrasando tudo. Era como ter uma linha de montagem super-rápida que parava constantemente porque um trabalhador tinha que medir cuidadosamente cada peça antes de passá-la adiante. O pesquisador descobriu que a forma padrão de lidar com essa conversão, que envolvia escalonamento e arredondamento complexos, criava um congestionamento que negava os benefícios de velocidade do novo hardware.

Para resolver isso, o pesquisador redesenhou o processo de conversão para ser direto e simplificado. Em vez de calcular uma probabilidade precisa e depois arredondá-la, seu método mapeia as pontuações brutas diretamente para os códigos específicos que o hardware utiliza. Isso elimina as etapas intermediárias que causavam atrasos. Quando testaram essa abordagem nos chips de última geração para data centers, os resultados foram impressionantes. Para certas formas comuns de dados, o novo método processou informações mais do que duas vezes mais rápido do que o padrão anterior, que dependia de números de maior precisão. Ele alcançou isso mantendo a saída precisa o suficiente para tarefas complexas como geração de vídeo e compreensão de linguagem. Em testes envolvendo um modelo de geração de vídeo, o novo método foi quase duas vezes mais rápido que a abordagem padrão, produzindo resultados que, embora finitos e utilizáveis, mostraram desvio mensurável e pontuações de similaridade mais baixas em comparação com a versão mais lenta e precisa.

No entanto, a história não é apenas sobre velocidade; é também sobre o que acontece quando o modelo tenta aprender. O pesquisador explorou se poderiam usar esses números de baixa precisão ultra-rápidos para todo o processo de treinamento, incluindo a passagem "backward", onde o modelo atualiza seu conhecimento. Eles descobriram que, embora a passagem "forward" pudesse rodar em velocidade total, a passagem "backward" exigia um compromisso cuidadoso. Quando tentaram usar o formato de quatro bits mais rápido para os valores de probabilidade durante o treinamento, o processo de aprendizado tornou-se instável e o modelo falhou em melhorar. Os números tornaram-se muito grosseiros, fazendo com que o sinal de aprendizado quebrasse. Consequentemente, o pesquisador determinou que, para o treinamento permanecer estável, eles deveriam usar um formato de oito bits ligeiramente mais preciso para os valores de probabilidade, mesmo que o restante do cálculo utilize o formato de quatro bits mais rápido. Essa abordagem híbrida permitiu acelerar todo o ciclo de treinamento em cerca de 14 por cento em um único chip poderoso, um ganho significativo para modelos de grande escala.

O pesquisador também observou os limites físicos dos próprios chips de computador. Ele descobriu que a velocidade do cálculo não era mais o problema principal; a questão era como os dados eram armazenados e movimentados dentro do chip. O chip possui uma área de memória pequena e ultra-rápida onde mantém os números enquanto trabalha neles. O pesquisador descobriu que esse espaço de memória estava completamente cheio, não deixando espaço para sobrepor diferentes estágios do cálculo. Era como uma cozinha onde o balcão está tão lotado de ingredientes que o chef não pode começar a picar o próximo vegetal até que o atual seja finalizado, mesmo que a faca seja incrivelmente afiada. Como o espaço de memória estava totalmente ocupado, o chip não conseguia trabalhar em múltiplas etapas ao mesmo tempo, o que limitava o quanto o processo inteiro poderia se tornar mais rápido.

Este trabalho destaca uma mudança crucial em como pensamos em tornar a inteligência artificial mais rápida. Não basta simplesmente construir calculadoras mais rápidas; todo o fluxo de trabalho deve ser redesenhado para corresponder às capacidades do hardware. O pesquisador mostrou que, ao mudar a forma como as probabilidades são calculadas e ao gerenciar cuidadosamente o fluxo de dados, eles poderiam desbloquear melhorias massivas de velocidade. No entanto, eles também provaram que existem limites rígidos. As restrições de memória do chip significam que, mesmo com a aritmética mais rápida possível, há um teto para o quanto de sobreposição é possível. O caminho a seguir, sugerem eles, não reside apenas em aritmética mais rápida, mas em formas mais inteligentes de organizar os dados para que os recursos do chip nunca fiquem esperando. Esse equilíbrio entre velocidade bruta e gerenciamento cuidadoso de dados é o que permitirá que a próxima geração de inteligência artificial opere de forma eficiente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →