← Últimos artigos
🤖 machine learning

Low-Rank Ternary Adaptation for Fine-Tuning Transformers

Este artigo propõe a "adaptação multiplicativa ternária", um novo método de baixo posto que permite o ajuste fino eficiente de transformers ternários ao representar atualizações de pesos discretos por meio de pequenas matrizes ternárias, preservando assim o domínio ternário e permitindo a fusão direta sem desquantização, enquanto recupera significativamente o desempenho em modelos de linguagem e de visão.

Autores originais: Alexandru-Dragos Manolache, Yunqiang Li, Jan van Gemert

Publicado 2026-08-26
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Alexandru-Dragos Manolache, Yunqiang Li, Jan van Gemert

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A inteligência artificial moderna depende de programas de computador massivos chamados transformers, que se tornaram o motor por trás de tudo, desde assistentes de escrita até geradores de imagens. Esses programas são incrivelmente poderosos, mas também são pesados, exigindo vastas quantidades de memória de computador e energia para funcionar. Para torná-los utilizáveis em dispositivos menores, como telefones ou laptops, pesquisadores passaram anos tentando encolhê-los. Uma estratégia popular é comprimir os números dentro do programa, transformando-os de valores complexos e de alta precisão em versões de baixa precisão e mais simples. Imagine pegar uma fotografia de alta resolução e reduzi-la a apenas algumas cores; a imagem torna-se menor e mais rápida de processar, embora algum detalhe seja inevitavelmente perdido. A forma mais agressiva desta compressão envolve limitar os números internos do programa a apenas três valores possíveis: negativo um, zero e positivo um. Esta abordagem, conhecida como quantização ternária, reduz a memória necessária em um fator de dez, potencialmente transformando um modelo que antes exigia um grande servidor em algo que poderia rodar em um laptop padrão.

No entanto, um problema significativo estagnou o progresso destes modelos ultracompactos. Embora os modelos sejam pequenos e eficientes, eles são difíceis de ensinar novas tarefas. Os métodos padrão para ensinar estes programas envolvem fazer pequenos ajustes contínuos em seus números. Mas quando um modelo é restrito a apenas três valores, ele não pode fazer pequenos ajustes; ele só pode inverter o sinal de um número de negativo para positivo, ou desligá-lo completamente. As técnicas existentes para ensinar estes modelos comprimidos geralmente exigem expandir temporariamente os números de volta ao seu tamanho total e pesado para realizar as mudanças, e depois espremê-los de volta. Este processo de expansão e recompressão introduz erros que degradam o desempenho do modelo, muitas vezes tornando o resultado final pior do que se nenhum ensino tivesse ocorrido.

Uma equipe de pesquisadores da Universidade Tecnológica de Delft e da Amazon desenvolveu uma nova maneira de ensinar estes modelos ultracompactos que evita este ciclo de expansão e erro. Em vez de tentar adicionar pequenos números contínuos ao modelo, o método deles trabalha diretamente dentro do sistema estrito de três valores. Eles projetaram um sistema que atua como um conjunto de interruptores, permitindo que o modelo inverta o sinal de seus números internos ou os desligue completamente, sem nunca deixar o estado comprimido. Para tornar isso eficiente, eles não tentaram ajustar cada número individualmente. Em vez disso, utilizaram uma estrutura matemática que permite que alguns padrões simples e pequenos controlem vastas seções do modelo de uma só vez. Esta abordagem, que eles chamam de adaptação ternária de baixo posto (low-rank ternary adaptation), permite que o modelo aprenda novas habilidades enquanto permanece perfeitamente comprimido.

Os pesquisadores testaram este método em vários tipos diferentes de inteligência artificial, incluindo modelos de linguagem capazes de raciocínio e modelos de visão que reconhecem imagens. Eles começaram com modelos que já haviam sido comprimidos para o limite de três valores e então aplicaram esta nova técnica de ensino. Os resultados mostraram que os modelos recuperaram muito da precisão que perderam durante a compressão inicial. Em testes envolvendo tarefas de linguagem, os modelos adaptados apresentaram um desempenho significativamente melhor do que tentativas anteriores que tentavam forçar o modelo a aprender através da expansão e recompressão. Por exemplo, em um modelo de linguagem com três bilhões de parâmetros, o novo método melhorou a precisão média em nove tarefas diferentes de aproximadamente 32 por cento para 38 por cento, além de tornar as previsões do modelo muito mais confiantes.

Talvez o mais importante seja que o resultado final deste processo é um modelo único e unificado que permanece em sua forma ultracompacta. Ao contrário de outros métodos que deixam para trás um conjunto separado e pesado de instruções que deve ser carregado ao lado do modelo pequeno, esta nova abordagem funde o aprendizado diretamente nos pesos minúsculos. Os pesquisadores descobriram que, para tarefas de visão, como identificar objetos em imagens, o método deles produziu um modelo que era muito mais preciso do que aqueles criados ao recomprimir após o aprendizado. Eles também descobriram que o processo de aprendizado funcionava redistribuindo os sinais dos números existentes, em vez de tentar trazer de volta à vida os números que haviam sido zerados. Isso significa que o modelo aprende reorganizando o que já possui, em vez de tentar criar novas conexões onde elas não existiam.

Este trabalho demonstra que é possível ensinar modelos de inteligência artificial altamente comprimidos sem sacrificar sua eficiência ou precisão. Ao respeitar os limites estritos do sistema de três valores e encontrar uma maneira de aprender dentro desses limites, os pesquisadores mostraram que esses modelos minúsculos podem ser tão capazes quanto seus equivalentes maiores para muitas tarefas. O método não requer memória extra ou poder de computação durante o uso, pois o aprendizado é totalmente integrado à estrutura do modelo. Isso abre as portas para executar inteligência artificial sofisticada em dispositivos com recursos muito limitados, levando capacidades poderosas para lugares onde anteriormente era impossível implantá-las.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →