← Últimos artigos
💬 NLP

GLASS: Global-Local Aggregation for Inference-time Sparsification of LLMs

GLASS é um framework sem necessidade de treinamento que melhora a esparcificação no momento da inferência para grandes modelos de linguagem, agregando ativações locais específicas do prompt e priores intrínsecos globais do modelo por meio de agregação de ranks, estabilizando assim a poda dinâmica de FFN e aprimorando significativamente a fidelidade da geração e a velocidade de decodificação, particularmente em cenários de prompts curtos e longos.

Autores originais: Amirmohsen Sattarifard, Sepehr Lavasani, Kunlin Zhang, Amirhossein Rajabpour, Hanlin Xu, Fengyu Sun, Negar Hassanpour, Chao Gao

Publicado 2026-05-14
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Amirmohsen Sattarifard, Sepehr Lavasani, Kunlin Zhang, Amirhossein Rajabpour, Hanlin Xu, Fengyu Sun, Negar Hassanpour, Chao Gao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca gigante e incrivelmente inteligente (um Modelo de Linguagem de Grande Escala, ou LLM) que pode escrever histórias, responder perguntas e resolver problemas. Mas essa biblioteca é tão massiva que não cabe no seu telefone ou laptop. É muito pesada, muito lenta e requer muita energia para funcionar.

Para fazê-la funcionar no seu dispositivo, você precisa "podá-la"—essencialmente, você precisa dizer para ela ignorar 50% de suas células cerebrais internas (neurônios) enquanto ela pensa, para que ela execute mais rápido e use menos memória.

O Problema: O "Jogo de Adivinhação" de Prompts Curtos
Métodos existentes tentam decidir quais células cerebrais manter olhando para a primeira coisa que você digita (o "prompt"). Eles dizem: "Ok, você fez uma pergunta curta, então manteremos esses neurônios específicos ativos."

O artigo argumenta que isso é como tentar planejar uma viagem inteira com base no primeiro passo que você dá ao sair pela porta.

  • Prompts Curtos: Se você fizer uma pergunta curta, o modelo não tem informações suficientes para saber quais neurônios são realmente importantes para a resposta longa que está prestes a gerar.
  • Respostas Longas: À medida que o modelo começa a escrever uma história longa, a "importância" dos neurônios muda. Aqueles que pareciam importantes para a pergunta curta podem ser inúteis para o restante da história.
  • O Resultado: O modelo fica confuso, comete erros e a qualidade da escrita cai porque manteve os neurônios errados e desligou os certos.

A Solução: GLASS (Agregação Global-Local)
Os autores propõem um novo método chamado GLASS. Pense no GLASS como um gerente inteligente que toma decisões usando duas fontes diferentes de informação, em vez de apenas uma.

  1. A Visão Local (O Sinal "Agora Mesmo"): Isso olha para o que você acabou de digitar. Pergunta: "Com base nesta pergunta específica, quais neurônios estão se acendendo agora?" Isso é bom para contexto, mas pouco confiável para perguntas curtas.
  2. A Visão Global (O Sinal "Intrínseco"): Esta é a grande inovação do artigo. Antes do modelo ver sua pergunta, os pesquisadores realizaram um teste especial onde deixaram o modelo conversar consigo mesmo usando um prompt vazio (apenas um espaço em branco). Eles perguntaram: "Quais neurônios este modelo sempre usa, não importa o quê?" Isso cria uma "cola" dos neurônios mais importantes e confiáveis do modelo.

Como o GLASS Funciona: A Analogia do "Ranking"
O GLASS não escolhe apenas um ou outro. Ele usa um sistema de votação inteligente chamado Agregação de Ranking.

Imagine que você está escolhendo um time para um jogo esportivo:

  • Treinador Local diz: "O Jogador A é ótimo para este jogo específico."
  • Treinador Global diz: "O Jogador A é o melhor jogador que temos, ponto final, com base em toda a sua carreira."

Se você ouvir apenas o Treinador Local, pode escolher um jogador que é bom para uma jogada, mas ruim para o jogo inteiro. Se você ouvir apenas o Treinador Global, pode escolher um jogador estrela que não se encaixa na estratégia específica.

O GLASS combina os dois. Ele pega a lista "Local" e a lista "Global" e as funde. Se um neurônio é classificado alto por ambos os treinadores, ele definitivamente fica. Se um treinador está inseguro (como quando o prompt é curto), a opinião do outro treinador salva o dia.

O Truque da "Estimulação de Prompt Nulo" (NPS)
Para obter essa "cola" Global sem precisar de um conjunto massivo de dados de livros ou artigos da Wikipedia, os autores usaram um truque chamado Estimulação de Prompt Nulo.

  • Em vez de alimentar o modelo com um livro para ler, eles apenas deixaram que ele gerasse texto a partir do nada (um prompt "nulo").
  • Isso força o modelo a depender inteiramente de sua própria fiação interna. É como pedir a um músico para tocar uma escala sem partitura para ver quais dedos eles usam naturalmente mais. Isso fornece um mapa puro e imparcial dos neurônios mais críticos do modelo.

Os Resultados: Mais Rápido e Mais Inteligente
O artigo testou o GLASS em muitos modelos diferentes (como Llama, Gemma e Mistral) e descobriu:

  • Melhor Qualidade: Quando solicitado a escrever histórias longas a partir de prompts curtos, o GLASS cometeu muito menos erros do que métodos anteriores. Estava muito mais próximo da qualidade do modelo completo e não podado.
  • Velocidade Mais Rápida: Em um Samsung Galaxy S25 Ultra (um telefone de alta gama), o GLASS fez o modelo rodar até 11 vezes mais rápido em alguns casos. Isso aconteceu porque o modelo ficou pequeno o suficiente para caber inteiramente na memória rápida do telefone, evitando o processo lento de trocar dados constantemente para dentro e para fora.

Em Resumo
O GLASS é uma ferramenta "plug-and-play" que faz grandes modelos de IA rodarem em dispositivos pequenos. Ele corrige o problema de "adivinhar errado" em perguntas curtas combinando o que o modelo está fazendo agora com o que o modelo é naturalmente bom, garantindo que a IA permaneça inteligente e rápida, mesmo quando trabalha com recursos limitados.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →