SelectInfer: Selective Neuron Loading and Computation for On-Device LLMs
O SelectInfer é um framework de otimização ao nível de neurônio que permite a inferência eficiente de Grandes Modelos de Linguagem em dispositivos, utilizando um perfilador offline para identificar e carregar e computar seletivamente apenas os neurônios mais importantes, reduzindo assim significativamente os custos de memória e computação sem comprometer o desempenho da tarefa.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem uma biblioteca gigante de conhecimento, tão vasta que contém a resposta para quase qualquer pergunta que você possa fazer. Isso é o que os cientistas chamam de Modelo de Linguagem de Grande Escala (LLM). Pense nisso como um cérebro de robô superinteligente que leu quase todos os livros da internet. Mas aqui está o problema: esse cérebro é tão grande e pesado que geralmente precisa de um centro de dados massivo e caro com supercomputadores poderosos para funcionar. É como tentar carregar uma biblioteca de tamanho real em sua mochila; simplesmente não cabe.
Recentemente, as pessoas quiseram colocar essa "biblioteca" em dispositivos menores, como os aparelhos inteligentes no seu bolso ou os computadores em carros autônomos. Esses são chamados de "dispositivos de borda" (edge devices). O problema é que esses dispositivos têm espaço e energia de bateria muito limitados. Se você tentar forçar a biblioteca inteira neles, o dispositivo trava ou roda tão devagar que se torna inútil. Os cientistas tentaram encolher a biblioteca espremendo os livros (tornando-os menores, mas mais difíceis de ler) ou jogando fora prateleiras inteiras (o que faz o robô esquecer coisas). Mas esses truques antigos costumam quebrar a capacidade do robô de pensar com clareza. A grande questão é: Podemos fazer esse cérebro gigante caber em uma mochila pequena sem perder sua genialidade?
Apresentamos o SelectInfer, uma nova ideia de pesquisadores da Universidade de Paderborn que sugere uma maneira inteligente de resolver este quebra-cabeça. Em vez de tentar encolher a biblioteca inteira ou jogar fora livros aleatórios, o SelectInfer age como um bibliotecário muito inteligente que sabe exatamente quais livros você precisa agora mesmo.
Veja como funciona, usando uma história simples. Imagine que o cére-lo de seu robô é uma fábrica enorme com milhares de trabalhadores (chamados de "neurônios"). Em uma fábrica normal, cada um dos trabalhadores aparece para trabalhar todos os dias, mesmo que não tenham nada para fazer. Isso desperdiça espaço e energia. Os pesquisadores descobriram que esses trabalhadores na verdade se dividem em dois grupos. Alguns são "Generalistas", que sempre aparecem, não importa o trabalho — como as pessoas que mantêm as luzes acesas e a máquina de café funcionando. Outros são "Especialistas", que só aparecem para tarefas específicas, como a equipe que conserta o encanamento ou a equipe que pinta as paredes.
O artigo mostra que, para qualquer tarefa dada, você não precisa de todos os especialistas, e definitivamente não precisa daqueles que não estão trabalhando hoje. O SelectInfer usa um truque de mágica de duas etapas para fazer a fábrica funcionar em um dispositivo pequeno:
Carregamento Seletivo (O Truque da Mochila): Antes mesmo de o robô começar a trabalhar, os pesquisadores usam um "perfilador offline" (uma espécie de batedor/explorador) para descobrir quais Generalistas e Especialistas são os mais importantes. Então, quando o robô está pronto para ir, ele apenas empacota esses trabalhadores específicos em sua mochila (memória). Ele deixa o resto para trás. Isso é como levar apenas as ferramentas que você precisa para uma viagem de acampamento em vez de toda a loja de ferragens. Isso permite que o robô caiba em dispositivos que anteriormente eram pequenos demais para contê-lo. Por exemplo, em um dispositivo com apenas 8 GB de memória (como um NVIDIA Jetson Orin Nano), um modelo que normalmente precisaria de 9 GB de espaço pode agora se espremer porque está carregando apenas os 70% essenciais de seus trabalhadores.
Computação Seletiva (O Truque Sob Demanda): Mesmo com uma mochila mais leve, o robô ainda tem que pedir a cada trabalhador para fazer seu trabalho, o que leva tempo. O SelectInfer adiciona uma segunda regra: uma vez que o robô começa a trabalhar, ele só pede aos trabalhadores mais relevantes para realmente fazerem a matemática para aquele momento específico. Se o robô estiver escrevendo um poema, ele não precisa da equipe de encanamento para calcular a rima. Ele apenas acorda os poetas. Isso faz o robô pensar muito mais rápido.
Os pesquisadores testaram isso em três cérebros de robôs diferentes (Llama3.2-3B, Llama3.2-1B e Qwen2.5-3B) em um chip de computador minúsculo. Eles descobriram que, ao usar este método, puderam rodar esses modelos gigantes em dispositivos que antes eram impossíveis de usar. Para o modelo de 3 bilhões de parâmetros, o SelectInfer fez com que ele rodasse cerca de 1,53 vezes mais rápido do que o método atual de espremer os dados (quantização de 4 bits) e mais de 13 vezes mais rápido do que tentar puxar dados de um disco lento.
Crucialmente, o artigo argumenta que isso não torna o robô "mais burro". Na verdade, para muitas tarefas como tradução e resumo de histórias, o SelectInfer foi, na verdade, mais preciso do que outros métodos que tentavam economizar espaço. Os pesquisadores descobriram que, enquanto outros métodos ou economizavam memória mas rodavam lentamente, ou eram rápidos mas esqueciam as coisas, o SelectInfer conseguiu equilibrar os três: economizou memória, acelerou o pensamento e manteve as respostas precisas.
O artigo descarta explicitamente a ideia de que você precisa jogar fora o modelo inteiro ou treiná-lo do zero para fazê-lo caber. Também mostra que simplesmente escolher trabalhadores aleatórios para deixar para trás (carregamento aleatório) faz com que o robô falhe completamente, provando que você precisa de um mapa inteligente para saber quem manter. Embora o método exija uma fase de "exploração" única para descobrir quais trabalhadores são importantes, os resultados sugerem que esta é uma maneira prática e poderosa de trazer uma IA superinteligente para os pequenos aparelhos em nossos bolsos sem a necessidade de um supercomputador na nuvem.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.