← Últimos artigos
💻 computer science

Rank-Gated and Sparse Low-Rank Adaptation for Efficient Fine-Tuning of Vision--Language Models

Este artigo introduz o Rank-Gated LoRA (RG-LoRA), um método que atribui pesos de importância aprendíveis aos componentes de rank do LoRA para permitir a poda pós-treinamento para eficiência de memória, mas experimentos iniciais no Qwen3-VL-8B mostram que, sem uma regularização de esparsidade explícita, os portões falham em aprender esparsidade significativa, resultando em ganhos negligenciáveis de latência ou VRAM, apesar de validar o mecanismo proposto de treinar-podar-avaliar.

Autores originais: Qinwu Xu

Publicado 2026-09-17
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Qinwu Xu

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os sistemas modernos de inteligência artificial que conseguem ver imagens e ler texto estão se tornando incrivelmente poderosos, mas também estão se tornando massivos. Esses modelos de visão-linguagem são construídos com bilhões de parâmetros, que são as configurações internas que permitem à máquina aprender. Para ensinar a esses gigantes uma nova tarefa, como ler um prontuário médico ou compreender um diagrama complexo, os pesquisadores tradicionalmente tinham que ajustar cada uma das configurações. Esse processo é como tentar reformar um arranha-céu substituindo cada tijolo; exige uma quantidade enorme de memória de computador e tempo, tornando muitas vezes impossível para a maioria dos pesquisadores realizá-lo. Para resolver isso, cientistas desenvolveram um atalho chamado Adaptação de Baixo Rank (Low-Rank Adaptation). Em vez de tocar em todo o edifício, este método adiciona um anexo pequeno e leve ao modelo que aprende a nova tarefa enquanto deixa a estrutura original, massiva, intocada. É uma ferramenta padrão para tornar esses grandes modelos úteis sem quebrar o banco com poder de computação.

No entanto, mesmo esses anexos leves possuem uma ineficiência oculta. Quando os pesquisadores os criam, devem adivinhar quanta "capacidade" o anexo precisará antes de iniciarem o treinamento. Eles escolhem um tamanho fixo, e o modelo usa cada parte desse tamanho, mesmo que apenas uma fração seja realmente necessária para o trabalho. É como construir uma mala com vinte compartimentos quando você só precisa de cinco, mas ainda assim tem que carregar o peso de todos os vinte. A nova pesquisa de Qinwu Xu, da Universidade do Texas em Austin, faz uma pergunta simples: e se o modelo pudesse decidir por si mesmo quais partes do anexo são úteis e quais não são, e então remover fisicamente as inúteis?

Os pesquisadores introduziram um método que chamam de Rank-Gated LoRA. Imagine o pequeno anexo como uma pilha de folhas transparentes, onde cada folha representa uma maneira diferente de o modelo aprender com os dados. Nos métodos padrão, o modelo é forçado a usar todas as folhas na pilha, independentemente de ajudarem ou não. Nesta nova abordagem, os pesquisadores adicionaram um interruptor minúsculo e aprendível a cada folha. Durante o processo de treinamento, o modelo aprende a mudar os interruptores das folhas úteis para "ligado" e os interruptores das folhas inúteis para "desligado". Uma vez terminado o treinamento, os pesquisadores podem cortar fisicamente as folhas que foram desligadas. O resultado é um anexo muito menor e mais eficiente que faz o mesmo trabalho, mas ocupa menos espaço e requer menos energia para funcionar.

Para testar se essa ideia funciona, a equipe aplicou-a a um grande modelo de visão-linguagem chamado Qwen3-VL-8B-Instruct. Eles treinaram o modelo em uma mistura de três conjuntos de dados envolvendo gráficos, texto em imagens e questões sobre documentos. Eles compararam seu novo método com a versão padrão de tamanho fixo. Os resultados mostraram que o novo método podia aprender tão bem quanto a versão padrão, alcançando uma precisão de aproximadamente 81,56 por cento nas questões de teste, o que foi muito próximo dos 81,95 por cento alcançados pelo método padrão. Isso provou que o modelo podia aprender efetivamente mesmo enquanto carregava o potencial de ser menor.

A parte mais interessante do experimento veio após o término do treinamento. Os pesquisadores pegaram o modelo treinado e começaram a remover as folhas menos importantes, uma a uma, para ver o quão pequenos poderiam tornar o anexo antes que o modelo começasse a falhar. Eles descobriram que o modelo era surpreendentemente robusto. Mesmo após remover três das oito folhas originais, restando apenas cinco, o desempenho do modelo na verdade melhorou ligeiramente em um conjunto de validação específico, atingindo 81,26 por cento. Isso sugere que o anexo original, maior, estava carregando um peso extra que não estava ajudando o modelo a pensar. Ao cortá-lo, o modelo desempenhou tão bem, ou até melhor, com menos material.

Apesar desse sucesso, os pesquisadores foram cuidadosos ao notar o que o experimento deles não provou. Embora o modelo pudesse tolerar ter partes removidas, os interruptores em si não aprenderam a desligar automaticamente durante o processo de treinamento. Eles permaneceram em uma posição quase idêntica à de onde começaram, o que significa que o modelo não descobriu naturalmente quais partes eram inúteis por conta própria. Os pesquisadores tiveram que decidir manualmente quais partes cortar após o fato. Além disso, como o anexo já era bastante pequeno para começar, cortá-lo não fez o modelo rodar significativamente mais rápido ou usar muito menos memória de computador em tempo real. O trabalho pesado ainda estava sendo feito pela espinha dorsal massiva e congelada do modelo principal, então as economias do pequeno anexo eram pequenas demais para serem mensuradas na velocidade geral.

O estudo conclui que o mecanismo funciona: é possível treinar um modelo com capacidade extra e depois remover cirurgicamente as partes não utilizadas sem prejudicar sua capacidade de compreender imagens e textos. No entanto, para que isso se torne um verdadeiro avanço em eficiência, trabalhos futuros precisam ensinar o modelo a desligar os interruptores por conta própria durante o treinamento e testar o método em anexos muito maiores, onde as economias seriam mais significativas. Por enquanto, a pesquisa serve como uma prova de conceito, mostrando que essas ferramentas digitais podem ser aparadas depois de construídas, pavimentando o caminho para uma inteligência artificial mais eficiente e adaptável no futuro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →