← 最新の論文
💬 NLP

LATMiX: Learnable Affine Transformations for Microscaling Quantization of LLMs

本論文は、既存の回転またはアダマール行列に基づく手法と比較して低ビットの大型言語モデルの精度を大幅に向上させるために、マイクロスケーリング(MX)量子化における活性化分布を最適化するために学習可能な可逆アフィン変換を採用する手法 LATMiX を紹介する。

原著者: Ofir Gordon, Lior Dikstein, Arnon Netzer, Idan Achituve, Hai Victor Habi

公開日 2026-04-27
📖 1 分で読めます☕ さくっと読める

原著者: Ofir Gordon, Lior Dikstein, Arnon Netzer, Idan Achituve, Hai Victor Habi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してください。あらゆる質問に答え、コードを書き、物語を語ることができる、巨大で驚くほど詳細な図書館(大規模言語モデル、または LLM)があると。問題は、この図書館があまりにも巨大で重く、保管コストが高く、読み取りが遅いことです。これを高速化し、低コスト化するために、エンジニアは本を要約して小さく単純な形式に変換しようとしています。このプロセスは量子化と呼ばれます。

しかし、落とし穴があります。これらの巨大な図書館では、数ページに「外れ値」が含まれています。それは、小さく単純化された形式には収まりきらない、極めて長く複雑な文です。これらの長い文を小さな箱に無理やり押し込もうとすると、押しつぶされて歪み、物語が台無しになります。

問題:「ブロック」のボトルネック

最近、これらの図書館を整理する新しい方法としてマイクロスケーリング(MX)が導入されました。図書館全体を一つの巨大な要約で縮小する代わりに、MX は本を小さなブロックに分割し、各ブロックに単語を測定するための独自の小さな定規(スケール因子)を与えます。これは、テキストの異なる部分をより柔軟に処理できるため、優れています。

しかし、ここにもひっかかりがあります。以前の手法は、図書館全体をくるくる回るコマのように回転させることで「外れ値」の問題を解決しようとしました。この回転を新しい「ブロック」定規と組み合わせようとすると、混乱を招きました。回転がブロックの測定を狂わせ、図書館が乱雑になってしまったのです。

これを解決するために、以前の研究者たちは回避策を試みました。つまり、図書館全体ではなく、各小さなブロック内のページだけを回転させ、残りを無視するという方法です。これにより混乱は収まりましたが、それは隣りの車線に立ち往生している車を無視して、単一の駐車スペース内の車だけを動かすことで渋滞を解消しようとするようなものです。全体像の問題は解決されませんでした。

解決策:LATMiX(賢い再配置者)

この論文の著者であるLATMiXは、縮小する前に本をより賢く再配置する方法を提案します。

モデル内のデータを、部屋にいる人々の群れだと考えてみてください。一部の人は巨大で密集した塊(外れ値)として立っており、他の人々は散らばっています。

  • 従来の手法は、部屋全体を回転させたり、小さなグループ内の人々をただ入れ替えたりしようとしました。
  • LATMiXは、名付け親のような振る舞いをします。それは、密集した群れを部屋全体に均等に広げるための、カスタムで柔軟なダンス(アフィン変換)を学習します。

この振り付けには、2 つの特別な特徴があります。

  1. 学習可能であること:単純な回転のような事前に設定されたダンスを使うのではなく、LATMiX は標準的な AI ツールを使用して、対象とするデータに特化した完璧なダンスの動きを学習します。どの場所も混雑しすぎないよう、エネルギーをどのように広げるかを正確に把握します。
  2. ブロックを尊重すること:それは「ブロック」定規(MX 形式)を認識しています。単に人々をランダムに入れ替えるのではなく、ブロックシステムと完璧に連携するように入れ替え、小さな定規が全員を正確に測定できるようにします。

仕組み(マジックのトリック)

この論文は、LATMiX が実際に読み取り時に図書館を遅くしないことを説明しています。それは、トリックが始まる前にカードを入れ替え、その入れ替えをデッキ自体に折り込んでしまうマジシャンのようなものです。トリックの準備が整えば、マジシャン(コンピュータ)は追加のシャッフル作業を行う必要はありません。カードはすでに完璧な順序で並んでいるからです。つまり、速度とメモリ使用量は以前と同じまま高速ですが、「縮小された」本の品質ははるかに高くなります。

結果

著者たちは、Llama や Qwen などのさまざまなモデルでこれをテストし、LATMiX が他の手法を一貫して上回ることを発見しました。

  • 精度の向上:「縮小された」モデルは、古い縮小技術を使用したモデルよりも間違いが少なく、質問をよりよく理解しました。
  • 頑健性:小さなモデルから非常に大きなモデルまで、さまざまなサイズのモデルで効果的に機能しました。
  • 効率性:モデルの実行に追加の時間やコストを加えることなく、これらの改善を達成しました。

要約すると、LATMiX は、圧縮する直前にデータを完璧に再配置する、賢く学習可能なツールです。これにより、最も極端な「外れ値」の情報さえも、失われることなく縮小プロセスを生き延びることが保証され、同時に現代のハードウェア形式とも調和して動作します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →