← Últimos artigos
🤖 machine learning

Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference

Este artigo introduz o Reduced Matrix Multiplication (RMM), um método de inferência adaptativo à entrada e livre de treinamento que reduz os custos computacionais em modelos baseados em Transformer, retendo seletivamente fatias informativas de produtos de matrizes, alcançando compensações escaláveis entre precisão e eficiência através de vários tamanhos de modelo, tarefas e modalidades sem modificar os pesos do modelo.

Autores originais: Zixuan Lan, Yanhong Li, Jiawei Zhou

Publicado 2026-08-14
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zixuan Lan, Yanhong Li, Jiawei Zhou

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine o cérebro de um computador moderno como um bibliotecário massivo e hiperinteligente. Este bibliotecário não apenas lê livros; ele os escreve, resolve problemas matemáticos e até observa imagens para contar histórias. Para fazer isso, ele usa um tipo especial de arquitetura cerebral chamada "Transformer". Pense em um Transformer como uma fábrica gigante onde a informação flui através de linhas de montagem. Em cada estação dessas linhas, a fábrica realiza um cálculo massivo: ela multiplica enormes grades de números entre si. Estas são as "multiplicações de matrizes" que alimentam a magia. O problema é que esses cálculos são incrivelmente pesados. Eles exigem muita energia e tempo, como tentar mover uma montanha de areia com uma colher de chá. À medida que esses modelos de IA se tornam mais inteligentes e maiores, a "montanha" fica mais alta, tornando caro e lento executá-los. Cientistas há muito se perguntam: o bibliotecário está realmente usando cada grão de areia nessa montanha para cada tarefa, ou existe muita areia desnecessária que poderíamos varrer sem que o bibliotecário percebesse?

Este artigo apresenta um novo truque inteligente chamado Multiplicação de Matriz Reduzida (RMM). Em vez de tentar encolher permanentemente a fábrica ou deletar partes da memória do bibliotecário (o que pode quebrar as coisas), a RMM atua como um filtro inteligente e instantâneo. Toda vez que o bibliotecário está prestos a realizar um cálculo massivo, a RMM faz uma pausa e pergunta: "Quais números específicos nesta grade estão realmente fazendo o trabalho pesado agora?" Ela então escolhe apenas os mais importantes — digamos, os 50% ou 70% superiores — e ignora o restante para aquele momento específico. É como um chef que, em vez de picar todos os vegetais da geladeira para uma sopa, prova rapidamente o caldo e decide usar apenas as cenouras e cebolas que são necessárias para este sabor específico. O melhor de tudo? O bibliotecário não precisa ser retreinado ou ensinado a fazer isso; simplesmente funciona naturalmente com os números que ele já está gerando.

Os pesquisadores testaram essa ideia em uma grande variedade de modelos de IA, variando de pequenos com 1 bilhão de parâmetros a gigantes com 70 bilhões. Eles descobriram que esses modelos são surpreendentemente flexíveis. Quando reduziram a quantidade de matemática sendo feita ao manter apenas uma parte dos números, os modelos não desmoronaram. Na verdade, quanto maior o modelo, mais areia ele parecia disposto a deixar ir sem perder o juízo. Por exemplo, o modelo gigante de 70 bilhões de parâmetros conseguiu lidar com uma redução de 50% nos cálculos enquanto ainda respondia perguntas e escrevia histórias quase tão bem quanto antes. No entanto, o artigo também descobriu uma peculiaridade engraçada na forma como essas fábricas são construídas: as partes de "atenção" do cérebro (onde o modelo decide no que focar) são muito tranquilas e conseguem lidar facilmente com a perda de metade de seu trabalho. Mas as partes "MLP" (as partes que realmente processam e transformam a informação) são muito mais sensíveis; se você cortar demais ali, o modelo começa a tropeçar.

A equipe também mostrou que esse truque funciona para modelos que podem ver e falar, não apenas para os de texto. Eles até construíram ferramentas de software especiais para provar que pular esses números realmente faz o computador rodar mais rápido na vida real, especialmente quando as histórias ou frases ficam muito longas. Embora o artigo sugira que esta é uma maneira promissora de tornar a IA mais barata e rápida, ele também observa que não existe uma configuração "perfeita" para todos. Você tem que ajustar o quanto vai cortar com base no modelo específico e no que você está pedindo para ele fazer. Mas, no geral, a RMM oferece uma nova maneira, livre de treinamento, de tornar esses gigantes digitais mais leves, provando que, às vezes, fazer menos matemática pode realmente ajudar você a pensar com a mesma clareza.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →