← Últimos artigos
🤖 machine learning

TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization

Este artigo apresenta o TORQ, um framework de quantização pós-treinamento sem treinamento que emprega rotações ortogonais de dois níveis para abordar teoricamente desequilíbrios estruturais na quantização de ativações MXFP4, reduzindo assim significativamente a lacuna de precisão entre a inferência em 4 bits e os modelos de precisão completa em grandes modelos de linguagem.

Autores originais: Zukang Xu, Xing Hu, Dawei Yang

Publicado 2026-05-20
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zukang Xu, Xing Hu, Dawei Yang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando empacotar uma biblioteca massiva e caótica de livros (as "ativações" dentro de uma IA inteligente) em caixas de envio pequenas e uniformes (o formato "MXFP4") para que possam ser enviadas rapidamente e a baixo custo.

O artigo argumenta que simplesmente enfiar esses livros nas caixas não funciona bem. Os livros estão muito bagunçados, e as caixas têm uma forma muito específica e rígida. Isso causa dois problemas principais, que os autores chamam de TORQ (Rotação Ortogonal de Dois Níveis).

Veja como o artigo explica o problema e sua solução, usando analogias simples:

O Problema: Duas Formas de o Empacotamento Falhar

1. O Problema do "Um Vizinho Barulhento" (Desequilíbrio de Variância Inter-bloco)
Imagine que sua biblioteca é dividida em grupos de 32 livros. No sistema atual, cada grupo recebe um único "rótulo de tamanho" (um fator de escala) para todo o grupo.

  • O Problema: Na maioria dos grupos, os livros são pequenos e leves. Mas em alguns poucos grupos, há uma única enciclopédia gigante e pesada.
  • O Resultado: Por causa desse único livro pesado, o rótulo para todo o grupo precisa ser definido como "Extra Grande". Isso significa que todos os livros pequenos e leves desse mesmo grupo agora são forçados a entrar em uma caixa gigante. Eles são esmagados, perdidos ou transformados em zero porque a caixa é grande demais para conter seus pequenos detalhes. Alguns grupos "barulhentos" arruínam a precisão para todos os outros.

2. O Problema da "Prateleira Vazia" (Desequilíbrio na Utilização do Código Interno ao Bloco)
As caixas de envio (MXFP4) vêm com uma lista pré-impressa de tamanhos específicos que podem conter (um "código"). Esses tamanhos estão espaçados como degraus de uma escada: pequeno, médio, grande, extra-grande.

  • O Problema: Os dados reais de IA são como uma multidão de pessoas onde 90% são muito baixas e apenas 10% são altas.
  • O Resultado: Quase todos os dados caem nos degraus "pequenos" da escada. Os degraus "médios" e "grandes" ficam completamente vazios e não utilizados. É como ter um armazém cheio de caixotes gigantes, mas você só está usando os minúsculos, enquanto os grandes acumulam poeira. Isso é um desperdício massivo de espaço e potencial.

A Solução: TORQ (A Grande Reorganização)

Em vez de tentar forçar os livros bagunçados a caber nas caixas, os autores propõem rotacionar os livros antes de serem empacotados. Pense nisso como embaralhar o baralho para que as cartas pesadas e as cartas leves fiquem misturadas uniformemente, e as pessoas altas e as baixas fiquem espalhadas.

Eles fazem isso em duas etapas:

Etapa 1: O Embaralhamento Macro (Corrigindo o "Vizinho Barulhento")

  • A Analogia: Imagine que você tem 100 grupos de livros. Alguns grupos são pesados, outros são leves. Os autores usam um truque matemático (baseado no teorema de Schur-Horn) para trocar livros entre os grupos.
  • O Objetivo: Eles movem os livros "pesados" dos grupos pesados para os grupos leves, e vice-versa.
  • O Resultado: Agora, cada único grupo tem aproximadamente o mesmo peso total. Nenhum grupo único é dominado por um único livro gigante. Isso permite que o "rótulo de tamanho" de cada grupo seja definido para um tamanho médio perfeito, preservando os detalhes dos livros pequenos.

Etapa 2: O Embaralhamento Micro (Corrigindo a "Prateleira Vazia")

  • A Analogia: Agora que os grupos estão equilibrados, olhe dentro de um grupo. Os livros ainda estão agrupados na seção "pequena". Os autores rotacionam os livros dentro do grupo.
  • O Objetivo: Eles giram os livros para que se espalhem uniformemente por toda a escada de tamanhos. Em vez de 90% dos livros serem "pequenos", eles agora são distribuídos de modo que alguns atinjam os degraus "médios" e alguns atinjam os degraus "grandes".
  • O Resultado: Eles usam cada degrau único da escada. Nenhum espaço é desperdiçado. O "código" é totalmente utilizado.

O Resultado

Ao realizar essa rotação em duas etapas antes de a IA ser comprimida (um processo chamado Quantização Pós-Treinamento, o que significa que eles não precisam reensinar a IA), eles alcançam resultados surpreendentes:

  • Precisão: Eles conseguiram reduzir a IA para precisão de 4 bits (caixas minúsculas) sem perder muito de seu "poder cerebral". Nos testes, seu método (TORQ) foi muito mais inteligente que métodos anteriores, obtendo pontuações próximas à da IA de tamanho completo e não comprimida.
  • Velocidade e Tamanho: Como as caixas são menores, a IA roda mais rápido e ocupa menos memória em dispositivos como telefones ou servidores.
  • Sem Trabalho Extra: A "rotação" é calculada uma vez e depois incorporada aos pesos da IA. Quando a IA roda, ela não sente nenhuma lentidão extra; a rotação acontece automaticamente como parte da matemática.

Em resumo: O artigo diz: "Não tente espremer uma multidão bagunçada e desigual em uma caixa rígida. Em vez disso, embaralhe gentilmente a multidão para que todos fiquem espalhados uniformemente, e depois coloque-os na caixa. Isso faz a caixa funcionar perfeitamente."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →