← 最新の論文
💻 computer science

Infrared Universality of Collective Dynamics across Transformer and State-Space Architectures

本論文は、TransformerとMambaの両アーキテクチャが、微視的なメカニズムは根本的に異なるにもかかわらず、スローモードの連続体によって特徴付けられる共通の近赤外集団力学を発展させていることを示し、それによってこのような組織化の普遍性をTransformerを超えて拡張するとともに、認知場理論からの予測を支持するものである。

原著者: Byung Gyu Chae

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Byung Gyu Chae

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能という広大な風景の中で、研究者たちは、機械がいかにして記憶することを学ぶのかを理解しようと長年努めてきました。情報のシーケンス(文章の中の単語やビデオの中のフレームなど)を扱うために、二つの支配的なモデルの系統が登場しました。第一の系統である「トランスフォーマー(Transformers)」は、自己注意(セルフアテンション)と呼ばれるメカニズムに依存しており、これにより、モデルはあらゆる情報の断片の重要性を、他のすべての断片に対して同時に重み付けすることができます。第二の系統は、Mambaのような新しいモデルに代表されるもので、状態空間力学に基づいた異なるアプローチを採用しています。そこでは、モデルは時間の経過とともに進化する内部状態を維持し、新しいデータが処理されるたびにそのメモリを更新します。長年、科学者たちは、時間と記憶に関するこれら二つの根本的に異なる考え方が、実は機械の奥深くにおいて同じ基礎的な振る舞いへと導くのではないかと考え続けてきました。この問いが重要なのは、もし異なるアーキテクチャが同じパターンへと収束するのであれば、学習し記憶する能力は、設計者の特定のエンジニアリング上の選択肢ではなく、普遍的な原理によって支配されていることを示唆するからです。

ある研究者が、訓練されたMambaモデルの内部を調べ、そのメモリが実際にどのように機能しているかを確認することで、この仮説を検証しようと試みました。彼らは「状態密度の時間スケール(time-scale density of states)」と呼ばれる特定の特性に焦点を当てました。これは、本質的には、モデルがどれほど多くの異なる記憶の速度を保持しているかを示すマップです。本が主題別ではなく、読者の記憶からどれくらいの速さで消えていくかによって分類されている図書館を想像してみてください。数秒で忘れられる本もあれば、数分で、あるいは数年間にわたって残り続ける本もあります。研究者は、Mambaモデルにおけるこれら「消えゆく速度」の分布を確認したいと考えました。彼は、Mambaには層ごとに検証可能な、組み込まれたメモリメカニズムがあることを知っていました。第一に、その設計にエンコードされた生の内部メモリ速度、第二に、特定の入力に応じてそれらの速度がどのように変化するか、そして最後に、すべての複雑な計算が終了した後のブロック全体の集合的なメモリ速度です。

研究者は、これら三つの層は同一ではないことを発見しました。Mambaモデルの生の内部メモリは、広範な速度の範囲から始まりますが、モデルが情報を処理するにつれて、読み取っている内容に基づいてこれらの速度を選択的に再スケールします。この入力依存の調整はMambaのユニークな特徴であり、文脈に応じて内部時計を遅らせたり早めたりすることを可能にします。しかし、最も驚くべき発見は、研究者がモデルブロック全体の最終的な集合的出力を見たときに起こりました。内部で起きている複雑な速度の再編成にもかかわらず、最終的な結果は非常に特定の、安定したパターンへと落ち着いたのです。異なるシーケンス長にわたってメモリ速度を測定したところ、モデルは一貫して、非常に遅いメモリの広範かつ連続的な範囲を発達させていることがわかりました。これらの遅いメモリは消失するのではなく、代わりに滑らかで予測可能な連続体(コンティニュアム)を形成し、モデルがより長いシーケンスのデータを処理するにつれて、より明確かつ定義されたものとなりました。

これがMambaのデザインによる特異な現象なのか、それとも知的なシステムの一般的な規則なのかを理解するために、研究者は自身の知見をトランスフォーマー・モデルの振る舞いと比較しました。トランスフォーマーは、Mambaのような内部の状態空間メカニズムを持っておらず、代わりに注意メカニズムに依存しています。しかし、研究者がトランスフォーマーの集合的なメモリ速度を測定したところ、驚くほど類似したパターンが見つかりました。両方のアーキテクチャは、情報の処理方法という微視的な手法こそ全く異なるものの、非常に遅い、最も長く持続するメモリにわずかに重みがかかった、ほぼ平坦な分布を発達させたのです。物理学の言葉を借りれば、これは「準臨界(near-marginal)」状態であり、モデルが無限のメモリを持つ境界のすぐそばに位置しており、情報が停滞することなく長期間保持できる状態にあることを意味します。

この研究は、この遅いメモリの組織化が、特定の種類のニューラルネットワークだけの機能ではないことを裏付けています。研究者は、Mambaがトランスフォーマーとは異なる数学的構造を用いて明示的にメモリを構築しているにもかかわらず、両方のシステムが最終的に同じ方法で集合的なダイナミクスを整理することを明らかにしました。Mambaモデルのメモリの振る舞いは特定の値の周囲で安定することを見出しており、これは、全容を明らかにするのに十分な長さのシーケンスであれば、シーケンス長に関わらず、頑健で再現可能なパターンが生じることを示しています。このことは、長期的なメモリを維持する能力が、学習されたシーケンス処理の根本的な特性であり、異なるアーキテクチャの形態において自然に発生するものであることを示唆しています。これらの知見は、人工知能がどのように機能するかについての私たちの理解を広げるものであり、設計上の表面的な違いの下に、これらの強力なモデルが時間とメモリを扱うための共通の深い構造を共有していることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →