Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
本論文は、-gram埋め込みをのルックアップへと現代化するスケーラブルな条件付きメモリ・モジュールであるEngramを紹介し、ニューラル計算と静的メモリのトレードオフを最適化するU字型のスパース性配分則を明らかにすることで、大規模言語モデルにおける推論、コード、および長文コンテキスト検索の性能を大幅に向上させる。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
巨大で複雑なパズルを解こうとしているところを想像してみてください。長い間、最も賢いパズル解決者(AIモデル)は、巨大な工場のように構築されてきました。それらは、難しい論理や新しいアイデアを理解する必要がある時だけ登場する、何千もの専門作業員(「Mixture-of-Experts」または「MoE」と呼ばれます)を備えています。これは思考することには優れていますが、単純で退屈な事実を記憶することに関しては、少し不器用です。
このように考えてみてください。もし、ある天才的な数学者に「フランスの首都は?」と尋ねたら、彼らは単に「パリ」と言うだけではありません。彼らは、答えを導き出すために、毎回ゼロからフルメンタルシミュレーションを実行し、再導出しなければなりません。それは、自分の頭の中にある電話番号を調べるために、スーパーコンピューターを使用しているようなものです。
大きな発見:「脳のためのカンニングペーパー」
DeepSeek-AIと北京大学の研究者たちは、こう問いかけました。「もし、これらのモデルに対して、単に覚えておけばよい事柄のための専用の『カンニングペーパー』を与えたらどうなるだろうか?」
彼らは、Engramと呼ばれる新しいツールを導入しました。Engramは、AIにすべての単語を「思考」させる代わりに、超高速なO(1)ルックアップテーブル(これは、1つの単語を探すのも100万個の単語を探すのも、かかる時間が同じであることを意味します)として機能します。これは、古くからあるN-gram(単語のグループをまとめて見る手法)という概念に基づいたものですが、これを現代の技術でアップグレードし、巨大なAIの中で完璧に機能するように作り替えました。
「U字型」の秘密
チームは、モデルを構築する際の非常に興味深いルールを発見しました。彼らはこれをU字型のスケーリング則と呼んでいます。
固定された「脳のパワー」(計算ステップ)の予算があると想像してください。その予算をすべて「思考する作業員」(MoE)に使うこともできますし、すべてを「記憶のカンニングペーパー」(Engram)に使うこともできます。
- もし、予算の100%を思考する作業員に費やした場合、モデルは論理には優れていますが、事実の記憶には劣ります。
- もし、予算の100%をカンニングペーパーに費やした場合、モデルは事実を記憶していますが、推論をうまく行うことができません。
- スイートスポット: 研究の結果、最高のパフォーマンスは予算を分割した時に得られることが分かりました。つまり、両方が必要なのです。具体的には、余剰なメモリ予算の約**20〜25%**を思考する作業員から取り上げ、それをEngramメモリモジュールに与えることで、システム全体がより賢くなることが分かりました。これは、天才には速い脳だけでなく、優れた図書館が必要であると気づくことに似ています。
実際に何が起きたのか?(証明)
彼らはEngram-27Bというモデルを構築し、全く同じサイズと速度を持つ標準的な「思考のみ」のモデルと比較しました。結果は驚くほど強力でした。
- 知識: 知識問題や事実に関するスコアが向上しました(MMLUで**+3.4**、CMMLUで**+4.0**向上)。
- 推論: さらに驚くべきことに、一般的な推論や論理パズルにおいても大幅に改善しました(BBHで**+5.0**、ARC-Challengeで**+3.7**向上)。
- 数学とコード: コーディングや数学の能力も向上しました(HumanEvalで**+3.0**)。
この論文は、これが起こる理由について、Engramモジュールが「退屈な」事柄(例えば、「アレクサンダー大王」が特定の名前であることなど)を処理することで、メインの脳が思考するために時間を浪費せずに済むからだと示唆しています。これにより、AIの深い層が、より複雑で深い思考に集中できるようになります。それは、CEOが戦略に集中できるように、秘書がスケジュールの管理を行うようなものです。
「長い記憶」のトリック
最もクールな副作用の一つは、これらのモデルが長い物語を扱う能力です。Engramモジュールが局所的な詳細を瞬時に把握するため、メインのAIには物語の最初から最後までを記憶するための「注意(Attention)」がより多く残されます。テストでは、Engramモデルはテキストの干草の山の中から特定の針を見つける際、**97.0%の確率で成功しましたが、標準的なモデルは84.2%**しか成功しませんでした。
ハードウェアのマジック
最後に、この論文は、これが単なるソフトウェアのトリックではなく、ハードウェアにも優しいものであると主張しています。カンニングペーパーが固定アドレス(決定論的なID)を使用しているため、コンピュータは現在の計算を行っている間に、次のメモリのフェッチを開始することができます。これにより、1,000億パラメータのテーブルを通常のコンピュータのホストメモリ上に保存しても、超高速なGPU上にある場合とほぼ変わらない速度で結果を得ることができます。速度の低下は無視できる程度であり、**3%**未満でした。
これではないと明記されていること
論文は、これが何ではないかを非常に明確に述べています。
- これは単に語彙を大きくしたものではありません。彼らは語彙を大きくする(OverEncoding)ことも試みましたが、Engramほどの結果は得られませんでした。
- これは「思考」部分の代替物ではありません。思考する作業員(MoE)を完全に取り除くと、モデルは推論ができなくなります。メモリはヘルパーであり、代替品ではありません。
- これはすべてに対する魔法の解決策ではありません。論文では、Engramは事実や推論には役立つものの、読解力などの「バックボーン(基幹)」は依然としてメインのAIが行うものであり、それは静的なメモリよりもコンテキスト(文脈)に依存していると指摘しています。
彼らはどの程度確信しているのか?
著者たちは、自分たちの測定値に非常に自信を持っています。彼らは単にシミュレーションを行ったのではなく、2,620億トークンのデータを用いて実際のモデルを訓練し、現実世界のベンチマークでテストしました。彼らは「U字型」のルールが異なるサイズにおいても成立することを示し、パフォーマンスの向上が現実的で、測定可能で、再現可能であることを証明しました。彼らはモデル内部の「ゲート」を可視化し、設計通りに、名前やフレーズなどのためにメモリが実際に作動していることを示しました。
要約すると、この論文は、AIの未来は単に「より大きな脳」を作ることではなく、その脳により良く、より速く、よりスマートに情報を検索する方法を与えることにあると示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。