← Últimos artigos
🤖 machine learning

FluxBin: Flexible LUT-based Ultra-low-bit LLM Inference by Algorithm-Kernel Synergy

O FluxBin é um framework de co-design entre algoritmo e kernel que combina um novo método de decomposição binária desacoplada com um kernel CUDA especializado usando tabelas de consulta e mapeamento colunar virtual para permitir a inferência de LLMs de ultra-baixa bitagem com acelerações significativas, economia de energia e redução de memória, mantendo uma alta precisão.

Autores originais: Qingyao Yang, Runming Yang, He Xiao, Wendong Xu, Junyu Chen, Haobo Liu, Chenchen Ding, Ruihan Hu, Yik-Chung Wu, Ngai Wong

Publicado 2026-08-18
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Qingyao Yang, Runming Yang, He Xiao, Wendong Xu, Junyu Chen, Haobo Liu, Chenchen Ding, Ruihan Hu, Yik-Chung Wu, Ngai Wong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os modelos de linguagem de grande escala são programas de computador poderosos que podem escrever histórias, resolver problemas e manter conversas, mas eles trazem consigo um custo físico massivo. Para executar esses modelos, você precisa de quantidades enormes de memória de computador e energia, muitas vezes exigindo hardware especializado e caro que poucas pessoas podem acessar. Isso ocorre porque os modelos armazenam seu conhecimento em vastas grades de números, e manter todos esses números em sua forma original de alta precisidade ocupa espaço demais. Cientistas tentam há muito tempo encolher esses modelos comprimindo os números, de forma semelhante a transformar uma foto de alta resolução em um arquivo menor. Uma versão extrema dessa compressão é reduzir os números à sua forma mais simples, usando apenas dois valores, essencialmente transformando-os em uma série de interruptores de liga e desliga. Teoricamente, isso deveria tornar os modelos incrivelmente rápidos e eficientes, mas, na prática, os computadores lutam para usar esses números simplificados sem perder velocidade ou precisão. O processo de converter os números simplificados de volta para um formato utilizável muitas vezes leva tanto tempo que anula quaisquer ganhos de velocidade, deixando os modelos tão lentos quanto antes.

Uma equipe de pesquisadores encontrou agora uma maneira de quebrar esse impasse, criando um novo método que permite que esses modelos ultra-simplificados funcionem em altas velocidades sem perder sua capacidade de pensar claramente. Eles desenvolveram um sistema chamado FluxBin, que funciona alterando a forma como o computador lê a memória do modelo. Em vez de tentar converter os números simplificados de volta em números complexos toda vez que o modelo precisa calcular algo, o novo sistema usa uma tabela de consulta pré-fabricada. Imagine uma biblioteca onde, em vez de ler cada livro individualmente para encontrar uma resposta, você simplesmente consulta um código em uma prateleira e recebe instantaneamente a resposta final. Os pesquisadores construíram um programa de computador especializado que cria essas tabelas de consulta de uma forma que lida com as partes mais importantes do modelo com cuidado extra, garantindo que a informação mais crítica não seja perdida durante a compressão. Eles também projetaram uma nova maneira de organizar os dados para que o computador possa acessá-los suavemente, evitando os congestionamentos que costumam acontecer ao tentar ler informações esparsas ou dispersas.

Os resultados deste trabalho são significativos porque provam que a compressão extrema não tem que vir acompanhada de um custo de velocidade. Quando os pesquisadores testaram seu sistema em um chip de computador poderoso, descobriram que ele podia executar um modelo massivo, um que normalmente exige uma quantidade enorme de memória, em uma única placa de vídeo padrão. O sistema foi capaz de gerar texto quase seis vezes mais rápido do que a versão não comprimida padrão do modelo. Além disso, como o computador estava fazendo menos esforço pesado e movendo menos dados, ele usou cerca de dez vezes menos energia. Essa eficiência significa que modelos que anteriormente eram grandes demais para rodar em uma única máquina podem agora caber e operar efetivamente, abrindo as portas para que a inteligência artificial mais poderosa seja usada em lugares onde os recursos são limitados.

O sucesso desta abordagem depende de um equilíbrio cuidadoso entre como os dados são comprimidos e como o hardware do computador é instruído a lê-los. Os pesquisadores perceberam que simplesmente tornar tudo simples não era suficiente; eles tiveram que identificar quais partes do modelo eram mais sensíveis a erros e tratá-las de forma diferente. Eles criaram um método que separa o conhecimento do modelo em uma base geral e simplificada e um conjunto de notas detalhadas especiais para as partes mais importantes. Essa abordagem híbrida garante que o modelo mantenha sua inteligência enquanto ainda se beneficia da velocidade do formato simplificado. Ao combinar essa estratégia de compressão inteligente com um programa construído sob medida que roda diretamente no processador do computador, eles eliminaram a necessidade das etapas de conversão lentas que prejudicaram as tentativas anteriores. O sistema funciona mapeando os dados simplificados diretamente para resultados pré-calculados, permitindo que o computador pule a matemática inteira e vá direto para a resposta.

Em seus experimentos, a equipe testou seu método em várias versões diferentes de modelos de linguagem de grande escala, variando de modelos menores a modelos massivos com bilhões de parâmetros. Em todos os casos, o novo sistema entregou um aumento dramático na velocidade e uma redução massiva no consumo de energia. Para os maiores modelos testados, o sistema foi capaz de executá-los em uma única placa de computador onde a versão padrão teria falhado completamente devido à falta de memória. A precisão dos modelos permaneceu alta, igualando o desempenho de outros métodos avançados que exigem muito mais tempo e poder de computação para serem configurados. Os pesquisadores observaram que seu método funciona sem a necessidade de retreinar os modelos, o que significa que pode ser aplicado a sistemas existentes imediatamente. Isso sugere que a barreira para rodar inteligência artificial poderosa em hardware comum não é mais uma questão de se é possível, mas sim de usar as ferramentas certas para desbloquear o potencial que já estava lá.

As implicações deste trabalho estendem-se para além de apenas tornar os modelos mais rápidos; elas mudam fundamentalmente a relação entre software e hardware. Durante anos, o campo ficou preso em um ciclo onde novos algoritmos eram projetados para eficiência teórica, mas não podiam ser realizados na prática porque o hardware não conseguia acompanhar. Esta nova abordagem preenche essa lacuna ao projetar o algoritmo e as instruções de hardware juntos, garantindo que cada etapa do processo seja otimizada para a máquina específica em que roda. Os pesquisadores demonstraram que, ao gerenciar cuidadosamente como os dados são armazenados e acessados, é possível alcançar níveis de desempenho que eram anteriormente considerados fora de alcance para modelos tão altamente comprimidos. À medida que a inteligência artificial continua a crescer em tamanho e complexidade, métodos como este serão essenciais para tornar essas tecnologias acessíveis e práticas para uma gama mais ampla de aplicações, desde dispositivos pessoais até grandes centros de dados. O trabalho mostra que, com a combinação certa de matemática inteligente e engenharia eficiente, as limitações da tecnologia atual podem ser superadas, permitindo um futuro onde a inteligência poderosa não é apenas um luxo, mas uma ferramenta padrão.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →