MapFormer: Self-Supervised Learning of Cognitive Maps with Input-Dependent Positional Embeddings
本論文は、リー代数生成子に由来する入力依存の位置符号化を利用した新たなトランスフォーマーベースのアーキテクチャであるMapFormerを導入し、これにより既存のAIモデルと比較して多様な認知タスクにおいて分布外一般化性とスケーラビリティを向上させた教師なし認知マップの学習を実現するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
新しい街を歩いていると想像してください。あなたは目にするすべての建物を一つずつ暗記するのではなく、心の地図を作ります。「左に曲がる」という行為は、パリにいようが東京にいようが、街に対するあなたの位置を必ず変えることを理解します。「どこにいるか(構造)」と「何を見ているか(内容)」を分けて理解するこの能力こそ、科学者が「認知的地図(cognitive map)」と呼ぶものです。
現在の人工知能(AI)システム、例えばあなたが会話するかもしれない大規模言語モデルは、パターンを暗記する能力に非常に優れています。しかし、それらはしばしば「脆い」ものです。学習した内容とわずかに異なる問題を解くよう求めると、失敗することがよくあります。状況の根本的なルールを理解することに苦労し、代わりに表面的な類似性に基づいて推測することに依存してしまいます。
本論文は、MapFormersと呼ばれる新しいタイプの AI アーキテクチャを紹介します。MapFormers は、単に景色を暗記するのではなく、道路のルールを学ぶ「心の GPS」を AI に与えるようなものです。
核心となるアイデア:「どこか」と「何か」の分離
著者らは、真に賢い AI になるためには、以下の 2 つを解きほぐす必要があると主張しています。
- 内容(Content): 目にする具体的なもの(例:赤いリンゴ、青い車)。
- 構造(Structure): 物事が移動したり関係したりするルール(例:「右に移動する」ことは常に右へ 1 歩移動させる)。
標準的な AI モデルはこれらを混ぜ合わせています。MapFormers はこれらを分離するように設計されています。そのために、リー群(Lie groups)(滑らかな回転や移動を記述する高度な方法)を用いた数学的なトリックを使用します。ルールをハードコーディングするのではなく、AI は入力に基づいて「移動行列」を生成することを学びます。
2 種類の MapFormers
論文は、このシステムの 2 つのバージョンを提示しており、著者らはこれを人間の記憶の種類に例えています。
- MapEM(エピソード記憶): これは日記のようなものです。「どこにいるか」と「何を見たか」を、別々の専用リストとして保持します。特定の過去の出来事(先週の火曜日の朝食が何だったかを正確に覚えているなど)を思い出すのに非常に優れていますが、処理速度は少し遅いです。
- MapWM(ワーキングメモリ): これは脳内の活動的なメモ帳のようなものです。「どこか」と「何か」をその場で混ぜ合わせます。これは RoPE(現在広く使われている AI 技術)の動作に似ており、より高速で効率的ですが、決定的な進化を遂げています。つまり、地図上を動的に移動することを実際に学習できる点です。
学習方法(トレーニング環境)
これらのモデルが機能することを証明するため、研究者たちはルールが隠された 3 つの特定の「ビデオゲーム」風の課題でテストを行いました。
- 「ノイズを無視せよ」ゲーム: AI はアイテムのリストをコピーするが、その間の空白は無視しなければなりませんでした。標準的な AI は空白に混乱しますが、MapFormers はノイズを「ゲート(遮断)」してコピーすべきアイテムにのみ集中することを学びました。
- 「目隠しナビゲーター」ゲーム: AI には「移動」と「視覚」のコマンドのシーケンスが与えられましたが、どちらがどちらかは教えられませんでした。AI は「上」が上へ移動させ、「木を見る」は視覚を更新するだけであることを突き止めなければなりませんでした。一度地図を学習すると、シーケンスがこれまで見たことよりもはるかに長くても、以前訪れた場所に戻った場合に何が見えるかを正確に予測できました。
- 「ネストされた括弧」ゲーム: これは深い論理階層(例:
((())))を処理する能力をテストします。シーケンスが長くなると、標準的な AI は閉じられるのを待っている開き括弧の数を数えるのに苦労します。MapFormers は開き括弧を「前進」、閉じ括弧を「後退」として扱い、学習したシーケンスよりもはるかに深いシーケンスでもスタックを完璧に追跡できるようにしました。
結果:なぜこれが重要なのか
論文は、MapFormers がほぼ完璧な汎化を達成したと主張しています。
- 「OOD」テスト: AI の用語で「分布外(Out-of-Distribution、OOD)」とは、モデルが一度も見たことのないシナリオでテストすることを意味します。シーケンスが長くなったり環境が変わったりすると標準的なモデルは惨敗しましたが、MapFormers は成功しました。それらは単に暗記したのではなく、問題の幾何学を学習しました。
- 実世界テスト: 研究者たちはまた、インターネットの実際のテキストの一部(OpenWebText)でもこれを試しました。論理ゲームほど改善は大きくありませんでしたが、MapFormers は標準的なモデルよりもわずかに良いパフォーマンスを示し、これらの原則が実際の言語タスクにもスケーリングできる可能性を示唆しています。
「秘密のソース」:コンパスとしての数学
論文は、MapFormers が「右へ移動する」などの動作を回転として扱う特定の数学的アプローチを使用していると説明しています。
- ダイアルを回していると想像してください。90 度回し、さらに 90 度回せば、180 度の位置に来ます。
- MapFormers は「右」が特定の回転であり、「左」がその逆の回転であることを学びます。
- この数学的枠組みを使用しているため、彼らは各ステップごとに複雑で遅い計算を行うのではなく、角度を単に足し合わせることで長い旅の結果(経路積分)を計算できます。これにより、シーケンスを理解しながらも情報を並列処理(非常に高速)することが可能になります。
まとめ
要約すると、この論文は、AI をより堅牢で適応性のあるものにするためには、それを巨大なパターンマッチング機械として扱うのをやめ、認知的地図を与えるべきだと提案しています。AI に「見るもの」から「移動のルール」を分離することを教えることで、MapFormers は現在の AI システムが欠いている柔軟性を持って、新しい見知らぬ状況 navigate できるようになります。彼らは推測するだけでなく、地図を理解します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。