← 最新の論文
🤖 machine learning

From Markov to Laplace: How Mamba In-Context Learns Markov Chains

本論文は、単層のMambaモデルがマルコフ連鎖における最適なラプラシアン平滑化推定量をインコンテキストで効率的に学習できることを示し、Mambaの畳み込みベースのアーキテクチャとベイズ的またはミニマックス的な最適統計推定との間の最初の形式的な関連性を理論的に確立するものである。

原著者: Marco Bondaschi, Nived Rajaraman, Xiuying Wei, Kannan Ramchandran, Razvan Pascanu, Caglar Gulcehre, Michael Gastpar, Ashok Vardhan Makkuva

公開日 2026-06-23
📖 1 分で読めます☕ さくっと読める

原著者: Marco Bondaschi, Nived Rajaraman, Xiuying Wei, Kannan Ramchandran, Razvan Pascanu, Caglar Gulcehre, Michael Gastpar, Ashok Vardhan Makkuva

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

全体像:新しい種類のAIの脳

現在の人工知能のスターであるTransformer(ほとんどのチャットボットのエンジン)を、非常に優秀だが体が重い「司書」だと想像してみてください。司書は本を一冊丸ごと読み、瞬時に繋がりを見つけ出すことができますが、本が長すぎると、すべての単語を一度に記憶しようとするため、疲れ果てて動作が遅くなってしまいます。

そこで登場するのが、より新しいタイプのAIモデルであるMambaです。これは、俊敏で足の速い「運び屋」のようなものです。情報をより速く処理し、メモリも節使用するため、重たい司書に代わる有望な選択肢となります。しかし、科学者たちは、この運び屋がいかにしてこれほど賢いのか、その仕組みを完全には理解していませんでした。うまく機能していることは分かっていましたが、その「秘伝のソース」が何なのかは分からなかったのです。

この論文は、探偵小説のように、Mambaがどのようにして**マルコフ連鎖(Markov Chains)**という特定のパズルを解いているのかを解明する物語です。

パズル:次のステップを予測する

研究者たちは、Mambaをテストするために「次トークン予測(Next Token Prediction)」というゲームを与えました。

  • 設定: 色付きのビーズの列(赤、青、赤、赤、青……)のような、一連の出来事を想像してください。
  • ルール: 次のビーズの色は、その直前の数個のビーズの色によって決まります。これが「マルコフ連鎖」です。
  • 挑戦: モデルはあるランダムなビーズの列を見せられ、次のビーズを推測しなければなりません。重要なのは、ゲームのルール(青の次に赤が来る確率など)が、新しい文字列ごとに変化することです。モデルは、現在の文字列を見るだけで、その場でルールを理解しなければなりません。これは**インコンテキスト学習(In-Context Learning: ICL)**と呼ばれます。

発見:Mambaは完璧な統計学者である

研究者たちは驚くべき発見をしました。わずか1層のMamba(非常にシンプルなバージョンのモデル)であっても、このゲームにおいて完璧な統計学者になることを学習したのです。

統計学の世界には、ルールを完全に把握していない状態で次のビーズを推測するための「黄金律」が存在します。それはラプラス平滑化(Laplacian Smoothing)(または「Add-β」推定器)と呼ばれるものです。

  • 比喩: カードの束から次のカードを予想している場面を想像してください。もしこれまで10枚のエースを見て、キングを一度も見なかった場合、あなたは「次はエースだろう」と予想するかもしれません。しかし、賢い統計学者はこう考えます。「待てよ、まだキングを見ていないだけだ。もしかしたら、単に運が悪かっただけかもしれない」。そこで、彼らは「キングがゼロである」と断定してしまうのを避けるために、カウントに小さな「ゴースト」のキングを加えておきます。これにより、まだ見ていないものに対して「確率ゼロ!」と言い切ってしまうことを防ぎます。

論文の主張: Mambaはただ推測しているのではなく、数学的に、まさにこの「ゴーストのカウント」を完璧に行うように学習しています。Mambaは過去のパターンの出現回数を計算し、最適な統計的公式が要求するように、自動的にその小さな「平滑化」を適用しているのです。

秘密の材料:畳み込みの「懐中電灯」

研究者たちは問いかけました。「Mambaはどうやってこれを実現しているのか? それは複雑なゲーティング機構によるものか? それとも非線形活性化関数によるものか?」

彼らは、Mambaの一部を取り除いて、何が壊れるのかを確認する実験を行いました。

  • 発見: 最も重要な部分は**畳み込み(Convolution)**でした。
  • 比喩: 畳み込みを、Mambaが直近の過去に向けて照らす**「懐中電灯」**だと考えてください。
    • 次のビーズを予測するために、Mambaは「直近の数ステップで、『青』の後に『赤』が何回現れたか?」を知る必要があります。
    • 畳み込みは、履歴の上をスライドする窓のように機能し、これらのパターンを瞬時にカウントします。
    • 研究者たちは、もしこの「懐中電灯(畳み込み)」を取り除いてしまうと、Mambaは目が見えなくなり、タスクに失敗することを発見しました。逆に、もし「懐中電灯」だけを残し(複雑なゲーティングを除去し)、畳み込みだけを維持した場合、Mambaは依然として完璧にパズルを解くことができました。

重要な教訓: この「懐中電灯(畳み込み)」こそがヒーローです。これがあるおかげで、Mambaは過去を振り返り、パターンの出現回数を数え、最適な統計的平滑化を、深く複雑な脳を必要とせずに適用できるのです。

限界:懐中電灯はどのくらいの大きさが必要か?

論文では、このパズルがどれほど難しくなるかについても調査しました。

  • ゲームが直前の1つのビーズに依存する場合(1次マルコフ連鎖)、小さな懐中電灯で十分です。
  • ゲームが直前の5つのビーズに依存する場合(5次マルコフ連鎖)、5つのビーズを一度に見るために、より広い懐中電灯が必要になります。
  • 定理: 論文では、kk 個の前のステップに依存するゲームを扱うためには、モデルの「メモリサイズ(隠れ次元)」が kk に対して指数関数的に成長する必要があると証明されています。これはパスワードを覚えることに似ています。パスワードが長ければ長いほど、それを一度にすべて頭の中に保持しておくことは指数関数的に難しくなります。

Transformerとの比較

論文では、MambaとTransformer(重たい司書)を比較しています。

  • Transformer: この「カウント」のパズルを解くために、Transformerは通常、パターンを数えるための「誘導ヘッド(Induction Head)」と呼ばれるメカニズムを構築するために、2つの層(連携して働く2つの脳)を必要とします。単層のTransformerでは失敗します。
  • Mamba: Mambaは、畳み込みメカニズムが組み込まれており、カウントに効率的であるため、単層であっても即座にこれを解決します。

まとめ

この論文は、Mambaのインコンテキスト学習における超能力が、特定のアーキテクチャの特徴、すなわち**「畳み込み(Convolution)」**から来ていることを明らかにしています。

  1. Mambaは、ラプラス平滑化と呼ばれる手法を用いて、完璧な統計学者のように振る舞うことを学習します。これにより、シーケンス内の次のアイテムを予測します。
  2. これは、過去のパターンをカウントし、適切な統計的調整を適用するための**「畳み込みの懐中電灯」**を使用することで達成されます。
  3. これは非常にシンプルな単層モデルであっても可能であり、Transformerが同じ作業を行うにはより複雑な構造を必要とします。

著者らは、Mambaが単に高速なモデルであるだけでなく、データのカウントと平滑化を本質的に効率よく理解していることを証明し、Mambaをこれらの最適な統計的推定器に正式に結びつけた最初の事例であると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →