← 最新の論文
🤖 machine learning

TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization

本論文は、MXFP4 活性化量子化における構造的な不均衡を理論的に解決するために二段階の直交回転を採用し、大規模言語モデルにおける 4 ビット推論と全精度モデルの精度格差を大幅に縮小する、学習不要なポストトレーニング量子化フレームワーク TORQ を紹介する。

原著者: Zukang Xu, Xing Hu, Dawei Yang

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Zukang Xu, Xing Hu, Dawei Yang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、スマートな AI の内部にある膨大で混沌とした書籍の図書館(「アクティベーション」)を、小さく均一な輸送用箱(「MXFP4」形式)に詰め込み、迅速かつ安価に輸送できるようにしようとしていると想像してください。

この論文は、これらの本を単に箱に詰め込むだけではうまくいかないことを主張しています。本はあまりに乱雑で、箱は非常に特定された硬い形状をしているからです。これにより、著者らがTORQ(Two-Level Orthogonal Rotation:二段階直交回転)と呼ぶ 2 つの主要な問題が生じます。

以下は、この論文が単純なアナロジーを用いて問題と解決策を説明したものです。

問題:梱包が失敗する 2 つの理由

1. 「うるさい隣人」問題(ブロック間分散の偏り)
あなたの図書館が 32 冊の書籍のグループに分かれていると想像してください。現在のシステムでは、各グループに対して、そのグループ全体に共通する 1 つの「サイズラベル」(スケーリングファクター)が割り当てられます。

  • 問題点: ほとんどのグループの本は小さく軽いですが、いくつかのグループには、1 冊の巨大で重い百科事典が含まれています。
  • 結果: その 1 冊の重い本のために、そのグループ全体に対するラベルは「エクストララージ」に設定されなければなりません。つまり、同じグループ内の小さく軽い本すべてが、巨大な箱に押し込まれることになります。箱が大きすぎて細部を保持できないため、それらの本は潰され、失われたり、ゼロに変換されたりします。いくつかの「うるさい」グループが、他のすべての人の精度を台無しにしてしまいます。

2. 「空の棚」問題(ブロック内コードブック利用率の偏り)
輸送用箱(MXFP4)には、保持できる特定のサイズのリスト(「コードブック」)が事前に印刷されています。これらのサイズは、はしごの段のように間隔を空けて配置されています:小、中、大、エクストララージ。

  • 問題点: 現実世界の AI データは、90% が非常に背が低く、10% だけが背が高い人々の群れのようなものです。
  • 結果: ほぼすべてのデータがはしごの「小」の段に収まります。「中」や「大」の段は完全に空で、使われません。巨大なcrate(木箱)でいっぱいの倉庫を持っているのに、小さなものしか使わず、大きなものは埃を被っているようなものです。これはスペースと可能性の巨大な無駄です。

解決策:TORQ(大再編)

著者らは、乱雑な本を箱に無理やり押し込もうとするのではなく、梱包する前に本を回転させることを提案しています。これは、重いカードと軽いカードが均等に混ざるように、あるいは背の高い人と背の低い人が分散するように、カードのデッキをシャッフルすることと似ています。

彼らはこれを 2 つの段階で行います。

ステップ 1:マクロなシャッフル(「うるさい隣人」の修正)

  • アナロジー: 100 の本のグループがあると想像してください。いくつかのグループは重く、いくつかは軽いです。著者らは(シュール・ホーン定理に基づく)数学的なトリックを用いて、グループ間で本を交換します。
  • 目標: 「重い」本を重いグループから軽いグループへ、そしてその逆もまた同様に行います。
  • 結果: これで、すべてのグループがほぼ同じ総重量を持つようになります。どのグループも 1 冊の巨大な本によって支配されなくなります。これにより、すべてのグループの「サイズラベル」を完璧な中程度のサイズに設定でき、小さな本の細部を保持できます。

ステップ 2:マイクロなシャッフル(「空の棚」の修正)

  • アナロジー: これでグループがバランスが取れましたが、1 つのグループの中を見てみましょう。本はまだ「小」のセクションに固まっています。著者らはグループ内の本を回転させます。
  • 目標: 本を回転させて、サイズのはしご全体に均等に広がるようにします。「小」の本が 90% だったのが、これで「中」の段や「大」の段に当たるように分散されます。
  • 結果: はしごのすべての段を使用します。スペースは無駄になりません。「コードブック」は完全に活用されます。

結果

この 2 段階の回転を、AI を圧縮するに行うこと(これは「学習後量子化」と呼ばれ、AI を再教育する必要がないことを意味します)により、驚くべき結果が得られます。

  • 精度: 彼らは AI を 4 ビット精度(小さな箱)まで縮小しながら、その「脳の力」をほとんど失わずに済ませました。テストでは、彼らの手法(TORQ)は以前の手法よりもはるかに優れており、フルサイズで圧縮されていない AI に近いスコアを達成しました。
  • 速度とサイズ: 箱が小さくなるため、AI はより高速に動作し、携帯電話やサーバーなどのデバイス上のメモリ占有量が少なくなります。
  • 追加作業なし: この「回転」は 1 回計算され、AI の重み(ウェイト)に組み込まれます。AI が実行される際、追加の遅延は感じられません。回転は数学の一部として自動的に発生します。

要約すると: この論文は、「乱雑で不均一な群れを硬い箱に押し込もうとしないでください。代わりに、群れを優しくシャッフルして全員を均等に広げ、それから箱に入れてください。これにより、箱は完璧に機能します」と述べています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →