← 最新の論文
🤖 machine learning

Normalized Architectures are Natively 4-Bit

本論文は、重みと隠れ状態を単位超球面上に制約するアーキテクチャである nGPT が、構成的な信号蓄積を通じて自然に信号対雑音比を向上させることで、複雑な精度維持介入を不要としつつ、安定かつ効率的なエンドツーエンドの 4 ビット学習を可能にすることを示す。

原著者: Maxim Fishman, Brian Chmiel, Ron Banner, Daniel Soudry, Boris Ginsburg

公開日 2026-05-08
📖 1 分で読めます☕ さくっと読める

原著者: Maxim Fishman, Brian Chmiel, Ron Banner, Daniel Soudry, Boris Ginsburg

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

「正規化アーキテクチャはネイティブに 4 ビットである」という論文を、平易な言葉と日常的な比喩を用いて解説します。

大きな問題:低精度でコードを解読する

巨大で極めて複雑なレゴの城(大規模言語モデル)を建てようとしていると想像してください。通常、城が高く立ち、崩れないようにするために、巨大で頑丈なレンガ(高精度の数学)を使用します。

しかし、城をより速く建て、保存コストを削減するために、エンジニアは小さく壊れやすい 4 ビットのレゴレンガを使用したいと考えています。問題は、標準的な設計でこれらの小さなレンガを使用すると、城がしばしば崩壊したり、ぐらついたりすることです。これを修正するために、建設者は通常、構造が崩壊しないようにするために、高価な足場、追加の接着剤、そして複雑な測定ツール(「ランダム化ハダマード変換」や「テンソルごとのスケーリング」など)を追加しなければなりません。これらの修正はすべてを遅くします。

解決策:新しい設計図(nGPT)

この論文は、nGPTと呼ばれる新しい設計図を紹介しています。追加の接着剤で壊れやすい 4 ビットのレンガを補修しようとする代わりに、著者たちはレンガ自体の形状を変更しました。

nGPT では、モデルのすべての部分が「単位超球面」上に留まるように強制されます。

  • 比喩: 標準的なレゴレンガは、小さな小石から巨大な岩まで、あらゆるサイズになり得ると想像してください。これでは、すべてが小さければ整然と積み重ねるのは困難です。
  • nGPT の工夫: nGPT では、すべてのレンガが完璧な大理石のように、正確に同じサイズと形状になるように強制されます。それらはすべて、見えない球体の表面に収まるように制約されています。

この形状の制約により、モデルはネイティブに頑健であると論文は主張しています。追加の足場や接着剤なしに、小さな 4 ビットのレンガだけで完全に構築できます。それは単に機能します。

なぜ機能するのか?「合唱」効果

研究者たちは問いかけました:なぜこの球体の形状がモデルをこれほど強くするのか?

彼らはモデルがどのように数学を行うかを確認しました。モデルは、数千の数字を取り、それらを掛け合わせ、すべてを足し合わせる(「ドット積」)ことでこれを行います。

  1. 標準的な方法(GPT): 4,000 人の歌手の合唱団を想像してください。標準的なモデルでは、歌手たちは異なる音量で異なる音程を歌っています。それらを足し合わせると、ノイズ(小さな 4 ビットのレンガによる誤り)は相殺されますが、実際の歌(信号)は混沌の中に失われます。信号は弱いです。
  2. nGPT の方法: すべての歌手(数字)が同じサイズ(球面上)になるように強制されるため、彼らは自然とわずかに協調した方法で歌い始めます。完全に同期しているわけではありませんが、弱い正の相関を持っています。
    • 比喩: スタジアムで人々が「ウェーブ」を行うようなものです。ウェーブが小さくても、全員が同じ方向に動いているため、ウェーブは巨大で力強い動きへと成長します。
    • 結果: nGPT では、「信号」(意図された数学)が協調したウェーブのように建設的に積み上がります。「ノイズ」(小さなレンガからの誤り)は、ランダムな雑談のように相殺されます。

これにより、はるかに明確な信号が生まれます。論文はこれを高い**信号対雑音比(SNR)**と呼んでいます。

「平坦な景観」の利点

信号が非常に強く明確であるため、モデルは非常に安定します。

  • 比喩: 山を歩いていると想像してください。
    • 標準モデル: 荒々しく岩だらけの崖を歩くようなものです。わずかに間違った一歩(不適切な学習率や小さな数学的誤り)を踏むと、崖から転落する可能性があります。非常に慎重でなければなりません。
    • nGPT モデル: 広大な平坦な高原を歩くようなものです。大きなステップでも小さなステップでも、転落することはありません。クラッシュすることを心配することなく、どの方向へも歩くことができます。

これは、エンジニアが「学習率」(モデルが学習する速度)を何時間も微調整する必要がないことを意味します。大きく重いレンガに機能する設定は、小さな 4 ビットのレンガにも完璧に機能します。

彼らがテストしたもの

著者たちは理論について語るだけでなく、これらのモデルを構築してテストしました:

  • 小規模: 12 億パラメータのモデルをテストしました。
  • 大規模: 最大 300 億パラメータを持つ大規模な「エキスパート混合(Mixture of Experts)」モデルをテストしました。
  • 結果: すべてのケースにおいて、nGPT モデルは 4 ビット数学のみを使用して正常に学習しました。標準モデルが要求する追加の「接着剤」(RHT やスケーリング)は必要ありませんでした。実際、nGPT モデルは数学的誤りを修正するための追加作業を行わなかったため、しばしばより正確で高速でした。

結論

この論文は、低精度の数学を複雑なパッチで修正しようとするべきではないと主張しています。代わりに、アーキテクチャ自体を「量子化対応」に設計すべきです。モデルを球体の形状に強制することで、数学は自然に、小さな 4 ビットのレンガを処理するのに十分な頑健さを持ち、AI をより速く、安価に、品質を損なうことなく学習しやすくします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →