Do You Remember? Toward Memory-Centric Multimodal AI
本論文は、標準的なワンショット処理を共有行列と局所的なEMA更新を用いた再構成的メモリシステムに置き換える、メモリ中心のマルチモーダルAIアーキテクチャである「DoYouRemember」を導入しており、LLMの隠れ状態が視覚情報を破棄すること、およびハルシネーションを欠陥ではなく損失のあるメモリ展開に固有の特性として再定義することを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは覚えていますか? なぜAIは見たものを「忘れる」のか(そして、私たちはそれをどう解決したのか)
想像してみてください。あなたは友人の顔を見ています。あなたの脳は、高精細なビデオファイルを完璧に保存しているわけではありません。代わりに、脳はスナップショットを撮り、それをいくつかの主要なアイデア(笑顔の形、目の色など)へと圧縮します。そして後で思い出そうとする時、脳はそれらのアイデアに基づいて新しい画像を「再構築」します。それは再生(リプレイ)ではなく、創造的な再構築なのです。
では、超スマートなAIロボットがあなたの顔を見て、正確にどのような皮膚疾患があるかを告げた直後に、あなたの顔の画像をメモリから即座に削除したとしたらどうでしょう。これこそが、今日の最も高度なAIモデルが行っていることです。彼らは画像を完璧に「理解」しますが、その画像については何も「記憶」していません。
DoYouRemember と呼ばれる新しい研究は、人間の記憶の仕組みを模倣したシステムを用いることで、AIに見たものを実際に「記憶」させる方法を教え、この問題を解決しようとしています。
大きな発見:理解 記憶
研究者たちは、シンプルな問いからスタートしました。「もしAIが画像を完璧に説明できるなら、そのAIの脳内にはまだその画像が『見えて』いるのだろうか?」
彼らはこれをテストするために、3つのステップを持つマシンを構築しました。
- 圧縮器(The Compressor): 顔の写真を撮り、それを極めて小さなデジタル・ショートハンド(4K映画を数行のテキストコードに変換するようなもの)へと押しつぶします。
- 思考器(The Thinker): そのコードを巨大なAIの脳(大規模言語モデル)に投入し、皮膚の状態を分析させます。
- 再構築器(The Rebuilder): AIの「思考」(内部の隠れ状態)を取り出し、それを再び画像へと変換しようと試みます。
衝撃的な結果:
AIの思考から顔を再構築しようとしたところ、得られたのは……ノイズでした。純粋な砂嵐です。
AIは「この人は頬に赤い発疹があります」と完璧に言うことができましたが、その内部メモリには、その発疹に関する視覚的な情報は一切復元可能な形で残っていませんでした。それは、完璧な英語を話せるものの、元のフランス語の単語を完全に忘れてしまった翻訳者のようでした。AIは「意味」を理解しましたが、「画像」を破壊してしまったのです。
この論文は、これらのAIモデルにとって、理解することは記憶することと同じではないということを証明しています。AIは文章を作るために視覚データを消費し、その後、その視覚データを捨て去ってしまうのです。
失敗した試み:なぜ「バックプロパゲーション」は機能しなかったのか
解決策を見つける前に、チームはAIに記憶を保持させるための多くの方法を試みました。彼らは様々なメモリ・アーキテクチャを試し、**バックプロパゲーション(誤差逆伝播法)**と呼ばれる標準的な学習手法(これは、教師が学生の宿題に対して、どこが間違っているかを正確に計算して修正するようなものです)を使用しました。
彼らが試みたこと:
- AIに共有メモリ・ボードへの書き込みを行わせる。
- 異なるタイプの「対照学習(コントラスティブ学習)」(似たものを認識させる学習)を使用する。
- エラーとメモリの間の経路を短縮する。
結論: すべての試みが失敗しました。メモリ・ボードは凍結されたまま動かなかったのです。
なぜでしょうか? 論文では、これを**勾配キャンセル(Gradient Cancellation)**という数学的ルールで説明しています。9万人の人々が、同時に同じ小さなホワイトボードに書き込もうとしている場面を想像してください。ある人は猫を描こうとし、別の人は犬、また別の人は木を描こうとしています。もし全員が同時にマーカーで押し付ければ、その力は互いに打ち消し合い、ボードは空白のままになります。論文によれば、標準的な手法で共有メモリを訓練しようとすると、各画像からの「押し」は非常に弱く(画像の数 の平方根 の係数で減少する)、メモリには新しいことが何も学習されないのです。
解決策:「ローカル」な記憶のトリック
「グローバル」な教師(バックプロパゲーション)が問題を解決できなかったため、研究者たちは、脳内のニューロンが実際にどのように接続されているかに着想を得た、異なるアプローチを試みました。それが**ローカル学習ルール(Local Learning Rules)**です。
システム全体に自己修正を求めるのではなく、各画像がメモリ・ボードの全64スロットのうち、最も関連性の高い上位8箇所のみを更新するようにしました。彼らは、古い記憶を消去することなく、新しい記憶を穏やかに馴染ませる**指数移動平均(EMA)**という手法を用いました。
結果:
- メモリ・ボードの成功: 画像が特定の「スロット」のみを更新するようにしたことで、メモリ・ボードは多様性を保ち、ぼやけた状態になるのを防ぐことができました。
- 再構築の向上: この新しいメモリから顔を再構築しようとしたところ、明確で認識可能な顔が得られました。
- 未知の10枚のテスト画像において、このメモリシステムは再構築品質スコア(LPIPS)で0.123を達成しました。これは、可能な最高スコア(上限値)である0.071に非常に近い数値です。
- このメモリは、通常であれば16倍のスペースを必要とする情報を格納するために、わずか229,000個のパラメータしか使用しませんでした。
「スーパー・メモリ」の驚き:
メモリ・ボードをさらに大きく(1,024スロットまで)スケールアップさせたとき、驚くべきことが起こりました。メモリシステムが、元の「完璧な」圧縮手法よりも優れた性能を示したのです!
- 新しいメモリシステムは、未知の画像に対して0.056(LPIPS)を記録し、元の圧縮スコアである0.071を上回りました。
- なぜでしょうか? 元の圧縮は「ブロック状」のデジタル的なステップ(量子化)を使用していましたが、新しいメモリは滑らかで連続的な数値を使用していたからです。スロットが十分に多ければ、滑らかなメモリはブロック状のステップよりも隙間をうまく埋めることができるのです。
これが未来に意味すること
論文は、ハルシネーション(幻覚)(AIが作り話をしてしまう現象)はバグではなく、損失のある記憶(lossy memory)の仕組みにおける「特徴」であると結論付けています。あなたが顔を覚えていても、目の正確な色合いを間違えることがあるように、情報を圧縮するAIは、思い出そうとする際に欠落した詳細を「推測」しなければなりません。
著者らは、AIの新しい構築方法を提案しています:
- メモリ中心のAI(Memory-Centric AI): 画像を脳に投入してテキストを出力するだけでなく、すべての感覚(視覚、聴覚、触覚)が書き込みを行う持続的な「メモリ・マトリックス」を備えたAIを構築すべきである。
- ローカル・ルール: メモリをグローバルな修正(バックプロパゲーション)で訓練するのではなく、生物学的な脳が学習する方法を模倣したローカルなルール(上位8スロットの更新など)を使用すべきである。
彼らはこれを皮膚の健康状態の画像(患者の皮膚の20種類以上の異なる写真を撮影する3D皮膚解析器を使用)でテストしました。この領域は、医学的な状態を理解することと、正確な視覚的詳細を記憶することの両方が求められるため、非常に適しています。
要約すると: この論文は、現在のAIは、言葉を発した瞬間に見たものを「忘れて」しまうことを証明しています。しかし、グローバルな修正ではなく、ローカルで穏やかな更新を用いることで、記憶の訓練方法を変えれば、人間と同じように、見たものを記憶し、再構築し、検証できるAIを構築できるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。