Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
Este artigo apresenta o "Four Over Six" (4/6), uma técnica adaptativa de escalonamento de blocos para quantização NVFP4 que reduz o erro de quantização ao ajustar dinamicamente as escalas dos blocos para lidar melhor com valores grandes, alcançando assim desempenho de treinamento e inferência mais próximo do BF16 com sobrecarga computacional mínima.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando encaixar uma biblioteca massiva de livros em uma mala portátil minúscula. Os livros representam o "cérebro" de um Modelo de Linguagem Grande (IA), e a mala representa a memória do computador. Para que tudo caiba, você precisa encolher os livros.
Há muito tempo, temos usado um método chamado BF16 (um formato padrão de alta precisão), que é como empacotar os livros em caixas robustas e pesadas. É preciso, mas a mala enche rapidamente. Recentemente, engenheiros tentaram mudar para o NVFP4, um formato muito menor. Pense no NVFP4 como um conjunto de caixas de origami minúsculas e leves. Elas cabem muito mais livros na mala e fazem a IA rodar mais rápido, mas há um problema: como as caixas são tão pequenas, alguns dos livros "grandes" ficam espremidos, amassados ou perdem páginas. Esse "amassamento" é chamado de erro de quantização, e faz a IA cometer erros.
O Problema: A "Borda Irregular" das Caixas Pequenas
O artigo explica que o NVFP4 tem uma peculiaridade estranha. Ele possui tamanhos específicos que pode conter: 0,5; 1; 1,5; 2; 3; 4 e 6.
- Se um livro tem exatamente o tamanho 4, ele se encaixa perfeitamente.
- Se um livro tem tamanho 5, ele não cabe. Você é obrigado a forçá-lo na caixa de tamanho 4 ou na caixa de tamanho 6.
- Se você forçar um livro de tamanho 5 para dentro de uma caixa de tamanho 4, perde muita informação (ele fica esmagado). Se você o forçar para dentro de uma caixa de tamanho 6, desperdiça muito espaço (ele fica balançando).
Os autores descobriram que o "esmagamento" ocorre com mais frequência em livros que são quase tão grandes quanto a maior caixa (os valores "próximos ao máximo"). No método padrão, a mala é dimensionada para conter o livro absolutamente maior possível (tamanho 6). Mas isso deixa uma enorme lacuna onde livros de tamanho 5 são esmagados severamente.
A Solução: "Quatro sobre Seis" (4/6)
Os autores, Jack Cook e sua equipe, criaram um truque inteligente chamado Quatro sobre Seis.
Imagine que você está arrumando uma mala. Em vez de forçar cada item individual a caber em uma caixa de "Tamanho 6", você olha para cada grupo de itens.
- O Jeito Antigo: Você assume que todo grupo precisa de uma caixa de "Tamanho 6". Se um grupo tem um livro de tamanho 5, você o esmaga.
- O Jeito 4/6: Você verifica o grupo. Se o livro mais pesado desse grupo específico tem apenas tamanho 5, você diz: "Certo, não precisamos de uma caixa de Tamanho 6 para este grupo. Vamos usar uma caixa de Tamanho 4 em vez disso."
Ao mudar para uma caixa de "Tamanho 4" menor para aquele grupo específico, o livro de "Tamanho 5" (que agora é relativamente menor em comparação ao limite da caixa) cabe muito mais confortavelmente. Ele deixa de ser esmagado contra a borda.
A Analogia:
Pense nisso como um personagem de videogame pulando.
- NVFP4 Padrão: O jogo assume que o personagem pode pular até 10 pés. Se ele tentar pular 9 pés, o jogo arredonda para baixo para 8 pés (uma queda grande).
- Método 4/6: O jogo verifica o nível específico. Se a plataforma mais alta tem apenas 6 pés de altura, ele altera o "limite de pulo" para 6 pés. Agora, um pulo de 5 pés é arredondado para 6 pés (ou 4 pés) com muito mais precisão. O personagem não cai tão longe.
Como Funciona na Prática
O artigo descreve um algoritmo inteligente que examina cada pequeno pedaço de dados (chamado de "bloco") antes de embalá-lo:
- Ele tenta embalar o bloco em uma caixa de "Tamanho 6" e calcula quanto de informação é perdida.
- Ele tenta embalar o mesmo bloco em uma caixa de "Tamanho 4" e calcula a perda.
- Ele escolhe a caixa que causa menos dano (menos erro).
Geralmente, para blocos com números muito grandes, a caixa de "Tamanho 4" é a vencedora, pois faz com que os números "próximos ao máximo" se encaixem melhor.
Os Resultados
A equipe testou isso em um modelo massivo de IA chamado Nemotron 3 Nano (30 bilhões de parâmetros).
- Treinamento: Quando treinaram a IA usando 4/6, a IA aprendeu melhor e cometeu menos erros em comparação ao método padrão NVFP4. Ela ficou muito mais próxima do desempenho do método pesado e lento "BF16", mas manteve os benefícios de velocidade e tamanho do NVFP4.
- Velocidade: Eles mostraram que essa "embalagem inteligente" não deixa o computador mais lento. Adiciona menos de 15% de trabalho extra, o que é um preço ínfimo a pagar por uma precisão muito maior.
- Modelos Existentes: Eles também tentaram isso em modelos já treinados (como Llama e Qwen). Mesmo sem re-treinamento, o uso de 4/6 tornou esses modelos mais inteligentes e precisos em testes como compreensão de leitura e quebra-cabeças de lógica.
A Conclusão
O artigo afirma que, ao ser simplesmente mais inteligente sobre qual tamanho de caixa usar para diferentes grupos de dados — às vezes usando um "4" em vez de um "6" —, é possível parar o "esmagamento" de informações importantes. Isso torna a IA de baixa precisão (NVFP4) muito mais precisa, permitindo que executemos modelos de IA maiores e mais rápidos no hardware atual sem que eles percam seu "poder cerebral".
Eles até liberaram o código (kernels) para que outros possam usar esse método de "embalagem inteligente" nas novas GPUs Blackwell da NVIDIA.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.