← Últimos artigos
💻 computer science

FlashAttention for Scalable Vector Architectures

Este artigo apresenta o FlashAttention-V, uma implementação de FlashAttention em blocos otimizada para arquiteturas vetoriais escaláveis que acelera significativamente a inferência de transformers em CPUs ao aproveitar o paralelismo entre cabeças e o acesso eficiente à memória, alcançando até 42x de aceleração no prefill e 11x no decode, enquanto também destaca gargalos estruturais nos formatos de quantização atuais para execução de vetores longos.

Autores originais: Sonia Rani Gupta, Nikela Papadopoulou, Miquel Pericàs

Publicado 2026-08-20
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Sonia Rani Gupta, Nikela Papadopoulou, Miquel Pericàs

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os sistemas modernos de inteligência artificial, desde chatbots que redigem e-mails até assistentes de programação que depuram software, dependem de um tipo específico de programa de computador chamado transformer. Esses programas são construídos para compreender a linguagem ao observar como as palavras se relacionam umas com as outras em uma frase. Para fazer isso, eles utilizam um mecanismo chamado atenção, que atua como um holofote, permitindo que o sistema foque nas partes mais relevantes do texto enquanto ignora o restante. Embora esses sistemas sejam frequentemente executados em enormes centros de dados com poderosas placas de vídeo, há uma necessidade crescente de executá-los em dispositivos menores e cotidianos, como laptops, tablets e até mesmo microchips especializados encontrados na Internet das Coisas. Esses dispositivos menores costem usar um tipo diferente de processador projetado para lidar com muitos cálculos de uma vez, processando dados em linhas longas, conhecidas como arquiteturas vetoriais. No entanto, um grande obstáculo surgiu: o mecanismo de atenção é incrivelmente faminto por memória, exigindo que o processador busque e armazene constantemente grandes quantidades de dados, o que retarda tudo.

Pesquisadores da Universidade Tecnológica de Chalmers e da Universidade de Glasgow enfrentaram esse problema redesenhando a forma como o mecanismo de atenção funciona nesses processadores vetoriais. Eles criaram um novo método chamado FlashAttention-V, que altera a maneira como o computador organiza seu trabalho para se ajustar à forma única desses processadores. Em vez de tentar forçar o processador a lidar com uma pequena parte de dados por vez, o novo método agrupa múltiplos cálculos independentes em uma única linha larga de dados. Imagine uma linha de montagem de uma fábrica onde os trabalhadores geralmente lidam com um item por vez; essa nova abordagem permite que eles peguem uma bandeja inteira de itens e os processem todos de uma só vez, reduzindo drasticamente o tempo gasto caminhando de volta e para a frente até as prateleiras de armazenamento. Ao rearranjar a ordem das operações e compactar os dados de forma mais densa, os pesquisadores descobriram que poderiam fazer esses dispositivos menores rodarem significativamente mais rápido, especialmente ao lidar com curtos surtos de texto ou quando o dispositivo está gerando novas palavras uma por uma.

A equipe testou sua nova abordagem em vários modelos de linguagem diferentes, incluindo TinyLlama, Llama 3.2 e Qwen2.5, usando tanto hardware real quanto simulações computacionais detalhadas. Em uma placa de desenvolvimento física chamada Banana Pi BPI-F3, que utiliza um processador RISC-V, o novo método provou ser uma melhoria massiva. Quando o dispositivo estava se preparando para ler uma entrada curta, a nova abordagem foi entre doze e quatorze vezes mais rápida que a versão padrão não otimizada. Quando o dispositivo estava gerando texto palavra por palavra, foi quatro a cinco vezes mais rápido. Os pesquisadores também realizaram simulações extensas para ver como o método se comportaria se os processadores fossem construídos com linhas de dados ainda mais largas, capazes de lidar com pedaços muito maiores de informação de uma só vez. Essas simulações mostraram que, à medida que as linhas de dados cresciam em largura, os ganhos de velocidade continuavam a subir, atingindo até quarenta e duas vezes mais rápido que a versão básica nos melhores cenários de preparação de entradas.

No entanto, o estudo também revelou um limite distinto para o quanto esses dispositivos podem acelerar. Os pesquisadores descobriram que, embora a parte de atenção do programa se beneficie grandemente dessas linhas de dados mais largas, outras partes do sistema, especificamente as camadas que convertem números em previsões, não se beneficiam. Essas camadas utilizam uma forma específica de armazenar números chamada quantização, que comprime os dados para economizar espaço. A maneira como esses dados são atualmente empacotados cria um descompasso estrutural com as linhas de dados largas, forçando o processador a realizar um trabalho extra e ineficiente para separar e recombinar os números. As simulações mostraram que, para essas camadas específicas, o tempo economizado pelo processamento de mais dados foi completamente consumido pelo tempo gasto no rearranjo. Isso significa que, embora o mecanismo de atenção possa ser tornado incrivelmente rápido, a velocidade geral do sistema é atualmente contida por esses outros componentes, sugerindo que melhorias futuras exigirão uma mudança na forma como esses números são armazenados, não apenas como são processados.

As descobertas oferecem um caminho claro para tornar a inteligência artificial mais acessível em dispositivos cotidianos. O novo método, FlashAttention-V, consegue unir a lacuna entre o design dos modelos de linguagem modernos e as capacidades dos processadores vetoriais escaláveis. Ele prova que, simplesmente reordenando como o computador pensa sobre suas tarefas e empacotando os dados de forma mais eficiente, ganhos de desempenho significativos são possíveis sem a necessidade de novo hardware. A pesquisa confirma que, para tarefas curtas e geração de texto em tempo real, esses processadores otimizados podem ser altamente eficazes. No entanto, serve também como um alerta de que as formas atuais de comprimir dados para esses dispositivos podem estar atingindo um limite, e que desbloquear o potencial total de futuros processadores mais largos provavelmente dependerá de resolver o enigma de como armazenar e mover esses números comprimidos de forma mais inteligente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →