← Últimos artigos
🤖 machine learning

Search Your Block Floating Point Scales!

Este artigo apresenta o ScaleSearch, uma estratégia inovadora que otimiza os fatores de escala em Ponto Flutuante de Bloco por meio de uma busca granular nos bits da mantissa para reduzir significativamente o erro de quantização e melhorar o desempenho de modelos generativos de baixa precisão, incluindo um algoritmo especializado ScaleSearchAttention que alcança perda de desempenho próxima de zero.

Autores originais: Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa

Publicado 2026-05-13
📖 4 min de leitura☕ Leitura rápida

Autores originais: Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: Empacotar uma Mala Eficientemente

Imagine que você está tentando empacotar uma mala (a memória de um computador) para uma viagem. Você tem muitos itens (dados) para caber, mas a mala é pequena. Para fazer tudo caber, você precisa espremer os itens (isso é chamado de quantização).

No passado, ao empacotar um grupo de itens, você olharia para o maior item do grupo e diria: "Ok, vou encolher tudo o mais para que o maior item caia perfeitamente". Este é o método padrão usado pelos chips de IA modernos.

O Problema:
Os autores notaram que, apenas porque o maior item cabe, isso não significa que o resto dos itens está empacotado de forma eficiente. Às vezes, encolher tudo com base no maior item deixa muito espaço vazio ou esmaga os itens menores demais, tornando-os difíceis de reconhecer depois. É como tentar colocar um urso de pelúcia gigante e um botão minúsculo em uma caixa; se você dimensionar a caixa para o urso, o botão se perde no ruído.

A Solução: "ScaleSearch" (O Empacotador Inteligente)

O artigo introduz uma nova estratégia chamada ScaleSearch. Em vez de apenas olhar para o maior item e definir a regra uma vez, o algoritmo usa uma pequena "lanterna" e verifica algumas maneiras diferentes de empacotar a mala.

  • O Jeito Antigo: "O maior item tem 10 polegadas de altura. Vou definir minha escala para 10."
  • O Novo Jeito (ScaleSearch): "O maior item tem 10 polegadas. Mas espere... se eu definir minha escala para 9,5, o item grande ainda cabe, mas os itens médios ficam muito mais claros. Se eu definir para 10,5, os itens pequenos ficam melhores. Deixe-me testar rapidamente essas poucas opções e escolher a que faz o grupo inteiro parecer o melhor."

O artigo mostra que, ao fazer essa busca rápida e minúscula, o computador pode empacotar os dados com muito mais precisão, reduzindo o "erro de quantização" (a bagunça causada ao espremer dados) em cerca de 27%.

O Hardware Especial: NVFP4

Esse truque funciona especificamente por causa de novos chips de computador super-rápidos (arquitetura Blackwell da NVIDIA) que usam um formato chamado NVFP4.

Pense no método antigo de empacotar como usar uma régua com apenas marcas grandes (1, 2, 3). Os novos chips têm uma régua com marcas minúsculas e finas (1,0, 1,1, 1,2, etc.). ScaleSearch é a técnica que usa essas marcas minúsculas e finas para encontrar o ajuste perfeito, em vez de apenas chutar com as marcas grandes.

A Atualização de "Atenção": ScaleSearchAttention

Modelos de IA (como chatbots) precisam prestar atenção às palavras que já disseram para entender a próxima palavra. Essa "memória" é chamada de KV Cache. Armazenar essa memória ocupa muito espaço e deixa as coisas mais lentas.

Os autores criaram uma versão especial chamada ScaleSearchAttention.

  • O que faz: Aplica a lógica do "Empacotador Inteligente" à memória da IA.
  • O Resultado: Permite que a IA armazene sua memória em um formato muito compacto (4 bits) sem perder sua capacidade de entender o contexto.
  • A Analogia: Imagine um bibliotecário que geralmente precisa escrever o título de cada livro em detalhes completos (lento e volumoso). Com este novo método, o bibliotecário usa um código abreviado inteligente que é minúsculo e rápido de escrever, mas ele verifica o código duas vezes para garantir que não perdeu nenhum detalhe importante.

O Que Eles Provaram? (Os Resultados)

O artigo testou isso em modelos reais de IA (como Llama e Qwen) e ferramentas de geração de vídeo (como Mochi).

  1. Melhor Matemática e Raciocínio: Quando usaram ScaleSearch em problemas de matemática, a IA ficou significativamente mais inteligente. Para um modelo, a pontuação em um teste de matemática saltou 15 pontos comparado ao método padrão.
  2. Melhor Linguagem: Quando a IA escreveu histórias ou respondeu perguntas, cometeu menos erros. A "perplexidade" (uma medida de quão confusa a IA está) caiu, o que significa que a IA soou mais natural e humana.
  3. Velocidade: A melhor parte? Essa "busca" é tão rápida que mal deixa o computador mais lento. É como verificar três maneiras diferentes de amarrar os cadarços; leva um instante, mas garante que você não tropece depois. O sistema roda a 98% da velocidade do método padrão.

Resumo

O artigo diz: "Não apenas chute como encolher seus dados com base no maior pedaço. Dê um instante para verificar algumas opções próximas e você obterá um resultado muito mais claro e preciso, com quase nenhuma penalidade de velocidade."

Eles chamam isso de ScaleSearch, e quando aplicado à memória da IA, chamam de ScaleSearchAttention. Isso torna os modelos de IA mais inteligentes e eficientes sem a necessidade de hardware novo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →