← Últimos artigos
🤖 AI

TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

Este artigo apresenta o TileFuse, uma biblioteca de kernels de precisão mista próxima ao metal para NPUs AMD XDNA2 que funde desempacotamento, desquantização e operações de matriz para permitir suporte nativo e eficiente para inferência de LLMs quantizados no estilo AWQ, alcançando ganhos significativos de desempenho e eficiência energética sobre as bases de comparação existentes em dispositivos de borda cliente.

Autores originais: Wesley Pang, Gregory Hyegang Jun, Feiyang Liu, Deming Chen

Publicado 2026-06-11
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Wesley Pang, Gregory Hyegang Jun, Feiyang Liu, Deming Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um caminhão de entrega novinho e superveloz (a NPU) parado na sua garagem, mas o único mapa que você possui (o software) ensina a dirigir uma bicicleta velha e lenta. Você não consegue usar a velocidade do caminhão porque o mapa não sabe navegar em suas faixas.

Este é o problema de rodar chatbots de IA modernos (LLMs) nos novos chips de notebooks hoje. Esses chips possuem "motores de IA" poderosos (NPUs) projetados para economizar bateria e rodar rápido, mas o software geralmente força a IA a mudar sua forma para caber no motor, em vez de deixar o motor se adaptar à IA.

TileFuse é um novo conjunto de ferramentas que resolve isso. É como construir uma rodovia customizada de alta velocidade especificamente para o caminhão, permitindo que ele transporte cargas pesadas de dados comprimidos sem precisar parar para reembalá-los.

Aqui está como o artigo explica essa solução usando analogias simples:

1. O Problema: O Gargalo da "Reembalagem"

Normalmente, para rodar uma IA nesses novos chips, você precisa pegar os pesos "comprimidos" da IA (que são como livros compactados dentro de uma mala pequena) e descompactá-los em um formato volumoso (como tirar os livros da mala e espalhá-los sobre uma mesa) apenas para que o chip possa lê-los.

  • O Jeito Antigo: O chip lê a mala, desempacota os livros, coloca-os de volta em uma mala diferente e, só então, começa a ler. Isso desperdiça tempo e energia.
  • O Jeito TileFuse: O chip lê a mala, abre-a e lê os livros enquanto eles ainda estão sendo desempacotados. Ele faz tudo em um único movimento fluido.

2. A Solução: Kernels "Fundidos" (Fused)

Os autores criaram uma biblioteca chamada TileFuse. Pense em um "kernel" como um manual de instruções específico para o chip.

  • Fusão: Em vez de ter três trabalhadores separados (um para desempacotar, um para converter e um para calcular), o TileFuse combina todos em um super-trabalhador. Este trabalhador pega os dados comprimidos, converte-os em tempo real e realiza os cálculos, tudo de uma só vez.
  • O Resultado: Isso é como um chef que não apenas corta os vegetais; ele corta, tempera e cozinha em um único movimento contínuo. O artigo afirma que isso torna a parte de "desempacotamento" do processo até 2,8 vezes mais rápida para certas tarefas em comparação com métodos antigos.

3. O Layout "Intercalado": Organizando o Armazém

Grandes modelos de IA possuem listas massivas de números (pesos). O sistema de memória do chip tem um limite de quão longe ele pode alcançar para pegar a próxima peça de dado. Se os dados estiverem armazenados de forma bagunçada e espalhada, o chip terá que fazer viagens longas e lentas para obter a próxima peça.

  • A Analogia: Imagine um armazém onde as caixas estão empilhadas aleatoriamente. Uma empilhadeira tem que dirigir 15 metros para pegar a próxima caixa.
  • A Correção do TileFuse: Eles reorganizam o armazém (chamado de "Interleaved Pre-tiling") para que as caixas que a empilhadeira precisará a seguir estejam logo ao lado umas das outras. Isso permite que o chip pegue enormes blocos de dados em um único movimento suave, suportando modelos de IA muito maiores (até 32.000 itens de largura) que anteriormente não caberiam.

4. O Problema do "GEMV": O Engarrafamento

Chatbots de IA trabalham em duas fases:

  1. Prefilling (Pré-preenchimento): Ler um prompt longo de uma só vez (como ler um livro inteiro). Isso é rápido e fácil para o caminhão.
  2. Token Generation (Geração de Tokens): Escrever uma palavra de cada vez (como escrever uma frase). Isso é lento e complexo.
  • A Questão: Ao escrever uma palavra por vez, o "caminhão" do chip muitas vezes fica ocioso porque foi projetado para carregar grandes cargas, não pequenas. É como usar um caminhão de carga para entregar uma única carta; o motor está funcionando, mas o caminhão está vazio.
  • A Correção: O TileFuse redesenhou o fluxo de tráfego para esta fase. Em vez de enviar dados para apenas uma faixa da rodovia, ele distribui o trabalho por todas as 32 faixas do chip simultaneamente. Isso mantém todo o motor ocupado, mesmo quando a "carga" é pequena.

5. Resultados no Mundo Real

A equipe testou isso em notebooks AMD reais (Ryzen AI) e comparou com o uso da placa de vídeo padrão do notebook (iGPU).

  • Velocidade: Para a leitura de prompts longos (prefilling), a NPU com TileFuse foi até 2 vezes mais rápida que a placa de vídeo.
  • Bateria: Como a NPU é mais eficiente, ela utilizou 64% menos energia para realizar o mesmo trabalho.
  • A Ressalva: Para a escrita de uma palavra por vez (token generation), a NPU foi às vezes mais lenta que a placa de vídeo. Isso ocorre porque o "tempo de configuração" para configurar a NPU é muito longo para tarefas tão pequenas e rápidas.
  • A Solução Híbrida: O artigo sugere uma abordagem de "melhor dos dois mundos": Use a NPU para o trabalho pesado (leitura de prompts longos) e a placa de vídeo para as tarefas rápidas (escrita de palavras). Essa combinação oferece a melhor velocidade e autonomia de bateria.

Resumo

TileFuse é uma ponte. Ele pega os formatos de IA comprimidos populares que os desenvolvedores já usam (como o AWQ) e os faz rodar nativamente nos novos chips de IA da AMD sem a necessidade de alterar os modelos de IA em si. Ao fundir as etapas de desempacotamento e cálculo, organizar os dados perfeitamente e utilizar todo o poder das faixas do chip, ele torna a execução de IA em notebooks significativamente mais rápida e energeticamente eficiente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →