Measuring Maximum Activations in Open Large Language Models
本論文は 27 の現代のオープン LLM チェックポイントにわたる最大活性化の大きさを包括的に測定し、モデルファミリーとアーキテクチャに依存してピーク値がパラメータ数ではなくほぼ 4 桁の範囲で変動することを明らかにし、特に MoE モデルは密結合モデルに比べてピーク値が著しく低いことを示しており、これにより最大活性化は安定した低ビット量子化を確保するために報告されなければならない、非単調な重要な性質として確立される。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
巨大でデジタルな図書館を構築しているところを想像してください。その図書館では、非常に高速ですがやや壊れやすいロボットが本を読んでいます。このロボット(AI モデル)は、単語を一つずつ読み、物語を理解するために、一連の部屋(レイヤー)を通します。これらの部屋の中で、ロボットは処理するすべての単語に対して「興奮レベル」(活性化)を生成します。
ほとんどの場合、これらの興奮レベルは落ち着いており、管理可能です。しかし、瞬間的に、ロボットは特定の単語に対して極度に興奮し、エネルギーに巨大なスパイクを生じさせることがあります。
この論文は、小さなものから巨大なものまで、そして異なるメーカー(Qwen、Gemma、GPT-OSS など)のものまで、27 種類の異なるバージョンのロボットに対する安全点検報告書のようなものです。研究者たちは、シンプルだが決定的な問いに答えようとしていました:これらのエネルギーのスパイクはどのくらい高くなり得るのか、そしてロボットのサイズがスパイクの高さを決定するのか?
以下に、彼らが単純なアナロジーを用いて発見したことを示します。
1. 「音量ノブ」の問題
ロボットの内部エネルギーを音量ノブだと考えてください。スペースを節約し、安価なハードウェアでロボットを高速に実行するために、エンジニアはしばしば音量を低い設定(量子化)に下げようとします。
- 問題点: もしロボットが 1,000,000 の音量で突然叫んだ場合、しかしあなたの音量ノブが 10,000 までしか処理できないように設定されていたなら、その叫び声は「クリップ」されたり歪んだりします。ロボットはその単語のニュアンスを忘れ、物語全体がごちゃごちゃになってしまいます。
- 発見: 研究者たちは、これらすべてのロボットにおける最も大きな叫び声(最大活性化)を測定しました。彼らは、「大きさ」が激しく変動することを発見しました。あるロボット(Qwen3.5 など)はささやき声のようですが、他のロボット(Gemma3 など)はジェットエンジンが離陸するようなものです。
2. 大きいからといって常に大きいわけではない
より大きなロボット(より多くのパラメータ)は、自然と大きな声を出すだろうと思うかもしれません。
- アナロジー: それは、より大きな車は常にエンジン音が大きいと仮定するようなものです。
- 現実: 研究者たちは、これが真実ではないことを発見しました。あるファミリーの小さなロボットが、異なるファミリーの巨大なロボットよりもはるかに大きな声で叫ぶ可能性があります。「大きさ」は、単にどれほど大きいかに依存するよりも、**誰が作ったか(アーキテクチャ)とどのように訓練されたか(レシピ)**に依存します。
- 例: Gemma3 ロボットは、同サイズの Qwen3.5 ロボットよりも約70 万倍大きな声であることが発見されました。
3. 「MoE」のショートカット
一部のロボットは、「エキスパートの混合(Mixture of Experts: MoE)」と呼ばれる特別なトリックを使用します。これは、1 人の巨大な司書がすべての本を読む代わりに、100 人の小さな専門家がいて、各本に対して適切な 2 人または 3 人だけが呼び出される図書館だと想像してください。
- 発見: これらの「MoE」ロボットは、はるかに静かであることがわかりました。彼らの最も大きな叫び声は、同じサイズの「密(dense)(専門家のいない)」の兄弟よりも14 倍から 23 倍低いものでした。専門家の使用は、エネルギーをより閉じ込めたままに保つようです。
4. 叫び声はどこで起こるのか?
研究者たちは、ロボットの脳内のどこでこれらのスパイクが起きたかを正確に追跡しました。
- 発見: ほぼすべての場合(24 台のロボットのうち 22 台)、最も大きな叫び声は、情報が一つの部屋から次の部屋へ流れる**メインの廊下(残差ストリーム)**で発生しました。それは通常、サイドの部屋(アテンションや数学の部屋など)ではありませんでした。
- パターン: 一部のロボットは早期にスパイクを起こし、大きな声を維持します(ジャンプ・アンド・ホールドのように)。一方、他のロボットはゆっくりと積み上げ、最後に最も大きな声になります(段階的な登りのように)。
5. 訓練は音量を変えます
彼らはまた、新しいスキルを学ぶ学生のように、訓練の異なる段階にあるロボットも観察しました。
- 発見: ロボットがより長く訓練される(より多くの本を見る)につれて、それはわずかに大きくなる傾向があります。それは大きなジャンプではありませんが、ロボットが賢くなるにつれて「音量」は徐々に上がります。
構築者への結論
この論文は、ロボットの大きさを眺めるだけで、そのロボットがどれほど大きな声を出すかを推測することはできないと結論付けています。
- 教訓: これらのロボットを携帯電話などの小さなデバイスで実行できるように縮小しようとする前に、最初に彼らの最も大きな叫び声を測定しなければなりません。もしそうしなければ、音量ノブを低すぎに設定してしまう可能性があり、ロボットはエネルギーの急激なスパイクを処理できないため、幻覚を見たり間違いを犯したりし始めるでしょう。
著者らは測定ツールを公開しており、これらのロボットを構築する誰もが、圧縮を試みる前にこの「大きさ」を確認できるようにしています。これにより、ロボットが安定し、正確に保たれることが保証されます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。