← Últimos artigos
🤖 AI

TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration

O TileMix é um kernel de precisão mista centrado em tiles e livre de treinamento que acelera a inferência de LLMs de contexto longo ao rotear dinamicamente tiles de escores de atenção alinhados ao hardware entre caminhos FP16 e INT8 dentro de uma operação de atenção densa fundida, recuperando assim a precisão perdida por métodos de baixa precisão uniformes enquanto melhora o throughput.

Autores originais: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

Publicado 2026-08-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os grandes modelos de linguagem tornaram-se os motores por trás de uma nova geração de inteligência artificial, capazes de resumir livros inteiros, responder a perguntas complexas de documentos longos e manter conversas que abrangem milhares de palavras. Para fazer isso, esses modelos dependem de um mecanismo chamado atenção, que permite que eles pesem a importância de cada palavra em uma frase em relação a todas as outras palavras. Quando o texto é curto, esse processo é rápido. Mas conforme o contexto cresce para incluir capítulos inteiros ou contratos jurídicos, o custo computacional explode. O modelo deve calcular uma pontuação para cada par possível de palavras, criando uma grade massiva de dados que exige enormes quantidades de memória e poder de processamento. Esse gargalo tornou difícil executar essas ferramentas poderosas de forma eficiente em hardware padrão, especialmente ao lidar com as sequências longas exigidas para tarefas do mundo real, como análise jurídica ou revisão de prontuários médicos.

Pesquisadores tentaram resolver isso simplificando a matemática. Uma abordagem comum é reduzir a precisão dos números que o computador utiliza, mudando de cálculos de alta precisão para outros de baixa precisão mais rápidos. Isso é como mudar de medir ingredientes com uma balança de laboratório para usar uma colher de cozinha; é muito mais rápido, mas se você fizer isso para cada etapa de uma receita complexa, o prato final pode ter um sabor errado. Outra abordagem é pular cálculos inteiros, ignorando palavras que parecem sem importância. Embora isso economize tempo, corre-se o risco de cortar justamente as conexões que o modelo precisa para entender a história. O desafio tem sido encontrar uma maneira de usar a velocidade da matemática de baixa precisão sem sacrificar a precisidade da matemática de alta precisão, mantendo ao mesmo tempo a capacidade do modelo de ver o quadro completo.

Uma equipe de pesquisadores introduziu um novo método chamado TileMix, que aborda esse problema tratando o processo de atenção não como um bloco único e uniforme de trabalho, mas como uma coleção de pequenos blocos gerenciáveis (tiles). Imagine a enorme grade de pontuações de pares de palavras como um grande mosaico. Em vez de pintar todo o mosaico com um único tipo de tinta, o TileMix divide essa grade em pequenas seções quadradas alinhadas ao hardware. Para cada uma dessas seções, o sistema toma uma decisão de milésimos de segundo: este grupo específico de pares de palavras precisa do cálculo lento de alta precisão ou pode se dar bem com o de baixa precisão mais rápido? Essa decisão é tomada com base em um mapa pré-planejado que agrupa esses blocos, permitindo que o computador alterne entre alta e baixa precisão dentro da mesma operação sem parar para reorganizar os dados.

O núcleo desta inovação é um sistema de roteamento que atua como um controlador de tráfego para o processador do computador. Ele compacta essas decisões em um código conciso, essencialmente uma sequência de bits que diz ao processador qual caminho seguir para cada bloco. Se um bloco for marcado para alta precisão, o processador usa suas unidades matemáticas mais precisas. Se for marcado para baixa precisão, ele muda para suas unidades mais rápidas e eficientes em termos de energia. Crucialmente, ambos os caminhos atualizam um estado de memória compartilhado que monitora os resultados globais, garantindo que a saída final permaneça consistente. Isso permite que o sistema preserve a conectividade total do modelo — o que significa que nenhuma interação entre palavras é jamais ignorada — enquanto ainda colhe os benefícios de velocidade da matemática de baixa precisão para as partes do cálculo que podem tolerá-la.

Em seus experimentos, os pesquisadores testaram este método em vários modelos de linguagem de grande escala populares, incluindo LLaMA, Qwen e Vicina, usando sequências variando de 16.000 a 64.000 palavras. Eles compararam sua abordagem com o método padrão de alta precisão e uma versão que utilizava matemática de baixa precisão para tudo. Os resultados mostraram que usar matemática de baixa precisão para todo o cálculo frequentemente levava a uma queda significativa na precisão, fazendo com que o modelo perdesse detalhes ou falhasse em tarefas de recuperação de informações. No entanto, o TileMix foi capaz de recuperar a maior parte dessa qualidade perdida. Ao rotear cuidadosamente apenas grupos específicos de blocos para o caminho de alta precisão, o sistema manteve níveis de precisão muito próximos da linha de base de alta precisão total, enquanto simultaneamente alcançava velocidades de processamento muito maiores.

O estudo também explorou diferentes padrões para decidir quais blocos deveriam receber o tratamento de alta precisão. Eles descobriram que o arranjo importava; alguns padrões, que mantinham os cálculos de alta precisão em regiões espaciais específicas da grade de palavras, funcionavam melhor do que outros dependendo da tarefa. Por exemplo, certos layouts que preservavam a alta precisão para interações locais de palavras funcionaram melhor em tarefas de recall factual, enquanto outros foram mais robustos para respostas a perguntas gerais. Os pesquisadores demonstraram que este método pode ser aplicado sem retreinar os modelos, o que significa que pode ser implementado imediatamente em sistemas existentes. Eles também mostraram que a abordagem funciona bem com lotes de comprimentos variáveis e diferentes arquiteturas de modelos, sugerindo que é uma ferramenta flexível para melhorar a eficiência.

Fundamentalmente, o TileMix oferece um equilíbrio controlável entre velocidade e precisão. Ele sugere que o futuro do processamento de contexto longo eficiente não exige escolher entre ser rápido ou ser inteligente. Em vez disso, ao misturar inteligentemente os dois, os sistemas podem processar documentos longos a uma velocidade que se aproxima dos limites teóricos do hardware, sem as severas penalidades de precisão que vêm do uso de baixa precisão em todo lugar. Esta abordagem fornece um caminho prático para a implementação de modelos de linguagem de grande escala em cenários onde tanto a velocidade quanto a precisão são críticas, como na análise em tempo real de conjuntos de dados massivos ou ferramentas interativas que precisam compreender contextos longos e complexos instantaneamente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →