← 最新の論文
🤖 AI

Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

本論文は、非一様なE2M1 FP4フォーマットにおける学習の不安定性を引き起こす根本的な「収縮バイアス(Shrinkage Bias)」を特定し、既存のE2M1ベースの手法と比較して様々なモデルスケールにおいて優れた事前学習性能を達成するために、ランダム・アダマール変換を活用した一様な4ビット(E1M2/INT4)学習レシピであるUFP4を提案する。

原著者: Qian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou

公開日 2026-06-19
📖 1 分で読めます☕ さくっと読める

原著者: Qian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で信じられないほど複雑なレゴのお城(大規模言語モデル)を作ろうとしている場面を想像してください。建設をより速く、より安価にするために、標準的な重くて精密なブロックを使うのをやめて、新しい超軽量の小さな4ビット・ブロックに切り替えることにしました。

問題は、現在の「標準的な」軽量ブロック(E2M1と呼ばれます)が、奇妙で偏った形をしていることです。この論文の著者たちは、これらのブロックには隠れた欠陥があることを発見しました。つまり、それらを使用するたびに、自然に物事をわずかに縮小させてしまうのです。

以下に、彼らの発見と解決策を分かりやすく説明します。

1. 問題: 「縮む」ブロック

標準的なE2M1ブロックは、間隔が不均一であると考えてみてください。ブロック間の隙間が非常に小さいものもあれば、非常に大きいものもあります。

  • 欠陥: この間隔の不均一さのために、データをこれらのブロックに当てはめようとすると、数学的に「切り上げ」よりも「切り下げ」の方がわずかに多く発生してしまいます。
  • 結果: これにより、「収縮バイアス(Shrinkage Bias)」が生じます。それはまるで「漏れているバケツ」のようなものです。メッセージをモデルのレイヤーに通すたびに、メッセージはほんの少しずつ小さくなり、弱まってしまいます。
  • 累積効果: 何百ものレイヤーを持つ深いモデルでは、この小さな収縮が何度も繰り返されます。メッセージが終端に到達する頃には、メッセージはあまりにも縮んでしまい、モデルが制御不能(学習が不安定)になります。

2. 「魔法の回転」が状況をさらに悪化させた

データが大きすぎたり、変形したりする(外れ値)問題を解決するために、エンジニアは Random Hadamard Transform (RHT) と呼ばれるトリックを使います。

  • 比喩: あなたが砂の山を持っていて、そのほとんどが中央に大きな盛り上がり(外れ値)を作っていると想像してください。RHTは、その砂を混ぜ回して、トレイ全体に均一に広げるミキサーのようなものです。
  • 衝突: この「砂を混ぜる(RH T)」作業を行い、その後にその砂を偏ったE2M1ブロックに入れようとすると、砂は最悪の隙間に落ちてしまいます。この不均一な間隔を持つブロックは、混ぜられたばかりの砂を捉え、以前よりもさらに激しく縮小させてしまうのです。論文によれば、標準的なレシピはこのミキサーを使用することで、この「漏れているバケツ」の問題を以前よりも悪化させていることが判明しました。

3. 解決策: 「均一な」ブロック (UFP4)

著者らは、UFP4と呼ばれる新しいレシピを提案しています。偏ったE2M1ブロックを使う代わりに、E1M2/INT4と呼ばれる新しいブロックを使用します。

  • 違い: これらの新しいブロックは完全に均一です。ブロック間の隙間はすべて全く同じサイズです。
  • なぜ機能するか: 隙間が均一であるため、「収縮バイアス」が発生しません。「混ぜられた砂(RHTデータ)」がこれらの均一なブロックに落ちたとき、サイズを失うことなく完璧にフィットします。
  • 戦略: これらの新しい均一なブロックを用いることで、著者らは建設プロセス(順伝播、逆伝播、および重みの更新)のあらゆる部分で、安全に「ミキサー(RHT)」を使用できることに気づきました。以前は、モデルを壊さないように注意して、特定の場所でのみミキサーを使用しなければなりませんでした。今では、あらゆる場所でそれを使用できます。

4. 証明

チームは、3つの異なるサイズのAIモデル(小、中、大)でこの新しいレシピをテストしました。

  • 結果: 新しいUFP4(均一なブロック)で構築されたモデルは、古いE2M1(偏ったブロック)で構築されたモデルよりも、重い標準的なブロック(BF16)のパフォーマンスにずっと近い状態を維持できました。
  • 教訓: 「均一なグリッド」により、モデルは信号を失うことなく、より長く、より安定して学習することができます。

まとめ

この論文は、業界が「漏れているバケツ」を、穴を塞ぐことで直そうとしてきたと主張しています。しかし、バケツ自体の形が間違っているのです。バケツを「完全に均一な間隔」を持つものに切り替えることで、これまで危険すぎた強力な混合ツール(RHT)をようやく使用できるようになり、より速く、より安価で、より安定したAI学習が可能になります。

結論: 古い、偏った4ビット形式を修正しようとするのではなく、信号が縮んで消えてしまうのを防ぐために、新しい、均一な4ビット形式へと切り替えるべきです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →