← 最新の論文
🤖 machine learning

Statistically-Lossless Quantization of Large Language Models

本論文は、パラメータあたり4ビット未満でタスク損失のない精度を、5〜6ビットで分布損失のない忠実度を達成しつつ、FP16に対して1.7〜3.7倍の推論高速化を実現する、レイヤーごとの非対称量子化手法であるStatistically-Lossless Quantization(SLQ)を導入するものである。

原著者: Michael Helcig, Eldar Kurtic, Dan Alistarh

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Michael Helcig, Eldar Kurtic, Dan Alistarh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界を、本が紙ではなく純粋な数学で作られている巨大で賑やかな図書館だと想像してみてください。これらの「本」は大規模言語モデル(LLM)であり、物語を書いたり、方程式を解いたり、人間のようにチャットしたりできる超スマートなコンピュータです。しかし、そこには落とし穴があります。これらの図書館はあまりにも巨大なのです。本を読むには、巨大で高価、かつ電力を大量に消費するスーパーコンピュータが必要です。ほとんどの人が、自宅のリビングにそのようなものを置いているわけではありません。そのため、科学者たちはこれらの本を小さく、軽くする方法、つまり、普通のスマートフォンやノートパソコンに収まるようにする方法を模索してきました。このプロセスは「量子化(クオンタイゼーション)」と呼ばれます。これは、高解像度の写真を、より小さなファイルサイズに圧縮する作業に似ています。通常、ファイルを圧縮しすぎると、画像がぼやけたりピクセル化したりします(これは「非可逆的(ロスの多い)」圧縮です)。もし画像を完璧なまま保ちたいのであれば、ファイルサイズは巨大なままになります(これは「可逆的(ロスレス)」圧縮です)。科学者たちが問い続けてきた大きな疑問は、「AIの脳を、スマートフォンに収まるほど小さくしながらも、言葉が詰まったり幻覚(ハルシネーション)を起こしたりすることなく、テストに合格できるほど賢さを維持できるのか?」ということです。

「Statistically-Lossless Quantization of Large Language Models(大規模言語モデルの統計的にロスレスな量子化)」と題されたこの論文は、まさにその難しい中間領域へと踏み込んでいます。著者であるマイケル・ヘルジグ、エルダール・クルティッチ、ダン・アリスターは、ぼやけた小さなモデルか、完璧で巨大なモデルかのどちらかを選ぶ必要はないと主張しています。代わりに、彼らは「統計的にロスレス」な新しい縮小方法を提案しています。ここにある魔法のようなトリックがあります。彼らは、人間(あるいはAI自身)が質問に答えるとき、そこには常にわずかなランダム性が存在することに気づきました。もし同じAIに同じ質問を2回したとしても、気分によって友人の質問への答え方が変わるのと同じように、少し異なる答えを返すことがあります。著者たちは、もし縮小されたモデルが、その自然な「気分の浮き沈み」の範囲内に留まっていれば、それで十分であることを見出しました。彼らは、SLQ(Statistically-Lossless Quantization)と呼ばれる手法を作り上げました。これは、まるで熟練の仕立て屋のようです。AIの脳のすべての部分を同じ小さなサイズに切り取るのではなく、各部分がどれほど敏感であるかを正確に測定します。ある部分は非常に小さなスペース(わずか3.3ビット/パラメータまで)を与えられ、他の部分はもう少し多くのスペースを与えられます。

この論文は、AIの縮小に関する私たちの考え方を変える、いくつかの非常に具体的な発見を行っています。第一に、彼らは「縮小」を測定する特定の方法が極めて重要であることを証明しました。彼らはEAR(Expected Acceptance Rate:期待受容率)という指標を導入しました。これは「トークン一致スコア」のようなものです。もし元のAIと縮小されたAIが、選ぶであろう100単語のうち99単語で一致していれば、それは勝利です。彼らは、この完璧な一致を得るためには、数値をどのように縮小するかについて注意深くある必要があることを発見しました。彼らは、数値を「対称的(シンメトリック)」に縮小する方法(正の数と負の数を同じように扱う方法)は、実際には「非対称的(アシンメトリック)」な方法(データを完璧にフィットさせるためにスケールをずらす方法)よりも多くのノイズとエラーを生み出すことを数学的に示しました。これは、歪んだスーツケースを正方形の箱に押し込もうとするようなものです。もし無理やり中央に配置しようとすれば、うまく閉まりません。箱の形に合わせて、スーツケースをずらす必要があるのです。

その結果は非常に素晴らしいものです。彼らのSLQ手法を用いることで、Llama-3.3-70BやQwen3のようなモデルを、平均して3.3から4.7ビット/パラメータまで縮小しながら、「タスク・ロスレス」な精度(つまり、元の巨大なバージョンと同じテストに合格できる精度)を維持することに成功しました。もし彼らがさらに厳格になり、AIの内部的な「気分」(確率分布)をオリジナルとほぼ同一にする必要があるとすれば、5から6ビットが必要になります。しかし、最も素晴らしい点は、モデルが非常に小さくなったため、動作が大幅に高速化されたことです。著者らはこれを実際のハードウェアでテストし、縮小されたモデルが元のフルサイズのバージョンよりも1.7倍から3.7倍速いこと、そしてより少ないグラフィックスカードにも収まることを発見しました。また、GPTQやAWQといった古い手法は、この「統計的にロスレス」という目標において、ぼやけすぎているか、あるいは圧縮しすぎているかのどちらかであり、目標に達していないことが多いことも示しました。要約すると、この論文は、AIを「どこで」「どのように」縮小するかについてより賢明に対処することで、回答の質を犠牲にすることなく、巨大な脳を小さく、速く、そして驚くほど正確にできることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →