FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling
Este artigo apresenta o FOCUS, um framework de quantização pós-treinamento que melhora a precisão de FP4 para grandes modelos de linguagem ao empregar o Escalonamento de Relaxação Acoplada para desacoplar escalas de quantização aprendíveis de restrições de hardware e o Escalonamento de Dupla Granularidade para uma adaptação de pesos mais fina, alcançando desempenho de estado da arte sem sobrecarga adicional de inferência.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando encaixar uma biblioteca de conhecimento massiva e intrincada em uma mochila minúscula e portátil. Este é o dilema diário dos "Large Language Models" (LLMs), os cérebros de computador superinteligentes que podem escrever histórias, resolver problemas matemáticos e conversar como humanos. O problema é que esses cérebros são tão grandes que precisam de quantidades enormes de memória e energia para funcionar, tornando-os caros e lentos para usar em dispositivos comuns. Para resolver isso, os cientistas usam um truque chamado "quantização". Pense nisso como traduzir um filme de alta definição, 4K, para um formato de baixa resolução para que ele caiba em um celular antigo. O objetivo é encolher os dados sem perder o enredo. Recentemente, um novo formato superpequeno chamado "FP4" surgiu, suportado por chips de computador modernos, que promete encolher esses modelos ainda mais. No entanto, há uma pegadinha: espremer os dados tão pouco assim costuma fazer com que o modelo "esqueça" coisas ou fique confuso, perdendo precisão. A grande questão é: como encolher o modelo para esse tamanho minúsculo sem arruinar sua inteligência?
Este artigo apresenta um novo método inteligente chamado FOCUS para resolver exatamente esse problema. Os pesquisadores perceberam que a maneira atual de encolher esses modelos era muito rígida. Imagine que você está arrumando uma mala. A regra padrão diz: "Você deve usar exatamente as mesmas caixas pequenas e pré-fabricadas para guardar suas roupas, e deve usar essas mesmas caixas para desempacotá-las mais tarde". O artigo argumenta que isso é bobagem. Embora você precise usar as caixas pequenas para guardar as roupas (porque é o que cabe na mala), você não precisa usar essas mesmas caixas minúsculas para decidir como dobrar as roupas em primeiro lugar. Você poderia usar uma fita métrica gigante e flexível para planejar a organização e, então, apenas encaixar o resultado nas caixas pequenas.
O FOCUS utiliza essa percepção para melhorar a forma como os modelos são preparados para o formato minúsculo FP4. Ele introduz dois truques principais:
Coupled-Relaxation Scaling (CRS): Esta é a "fita métrica flexível". No método antigo, o computador tinha que usar uma régua muito grosseira e de baixa precisão para decidir como encolher os números, e tinha que usar essa mesma régua grosseira para montá-los novamente. O FOCUS diz: "Vamos usar uma régua superprecisa e de tamanho real para fazer a matemática do encolhimento e, depois, espremer o resultado em uma caixa bruta". Isso permite que o computador encontre uma maneira muito melhor de empacotar os dados sem quebrar as regras do formato minúsculo.
Dual-Granularity Scaling (DGS): Isso é sobre empacotar itens menores. O método antigo tratava um grupo inteiro de 32 números como um grande bloco, usando uma única régua para todos eles. Mas e se alguns números nesse grupo forem enormes e outros forem minúsculos? O FOCUS divide esse grupo grande em subgrupos menores (como cortar uma pizza grande em fatias) e dá a cada fatia sua própria régua personalizada. Isso permite que o computador se adapte aos detalhes específicos dos dados, em vez de forçar tudo em uma caixa de tamanho único.
Os resultados são impressionantes. Quando os pesquisadores testaram o FOCUS em vários modelos de IA diferentes (como Qwen e LLaMA), ele superou consistentemente todos os outros métodos. Por exemplo, em um modelo chamado Qwen3-4B, o FOCUS conseguiu recuperar 98,2% da precisão do modelo original ao usar o formato NVFP4, e 96,2% com MXFP4. Este é um salto significativo em comparação com técnicas anteriores, que frequentemente lutavam para permanecer acima de 90% ou 94%.
Crucialmente, o artigo mostra que o FOCUS não torna o modelo mais lento ou mais difícil de usar. Mesmo que o computador faça cálculos extras enquanto prepara o modelo (durante a fase de "treinamento" ou "calibração"), o modelo final roda tão rápido quanto qualquer outro modelo FP4. Leva cerca de 19 minutos para preparar um modelo Qwen3-4B em uma única GPU de alto desempenho, o que é, na verdade, mais rápido do que alguns métodos concorrentes. Os pesquisadores enfatizam que este é um método de "pós-treinamento", o que significa que eles não precisam reensinar o modelo do zero; eles apenas ajustam as instruções de empacotamento.
Em resumo, o FOCUS sugere que, ao afrouxar as regras sobre como calculamos o encolhimento (mantendo o formato de armazenamento final rigoroso), podemos encaixar esses cérebros de IA gigantes em espaços minúsculos sem perder sua inteligência. É um pouco como perceber que você pode dobrar uma camisa perfeitamente usando uma mesa grande, mesmo que só tenha uma gaveta pequena para guardá-la. O artigo prova que essa abordagem funciona melhor do que as formas antigas e rígidas, oferecendo um caminho para rodar IAs poderosas em dispositivos que atualmente não conseguem lidar com elas.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.