Meta-Representational Predictive Coding: Neuroscience-Informed Self-Supervised Learning
本論文は、能動的推論と並列ストリーム表現予測を活用することで、バックプロパゲーションや生の入力の生成モデルに依存することなく、生物学的に妥当なエンコーダーのみの学習を実現する、神経科学に基づいた自己教師あり学習フレームワークであるメタ表現的予測符号化(Meta-Representational Predictive Coding; MPC)を導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
大きなアイデア:読み込むのではなく、ちらりと見ることで学ぶ
猫がどのような姿をしているかを学ぼうとしている場面を想像してください。
- 従来の方法(従来のAI): あなたは猫の高解像度な巨大写真の前に座り、すべてのピクセル(毛並み、ひげ、背景など)を一度にすべて記憶しようとします。コンピュータは、画像全体がどのようになっているかを推測し、間違えたら、その間違いを修正するために複雑で数学的な「バックトラッキング(遡及)」の手法を使わなければなりません。これは、辞書を後ろから逆さまに読んで言語を学ぼうとするようなものです。
- 新しい方法(この論文のMPC): 代わりに、視界の中心にある小さな鋭い円(スポットライトのようなもの)だけを見ることができ、それ以外の部分はぼやけて見える「目」を持っていると想像してください。一度に猫の全体を見ることはできません。そのため、あなたは目を素早く動かし(サッカード/躍動性眼球運動)、耳を見て、次に尻尾を見て、次に足を見る、というように動かします。ピクセルを暗記しようとするのではなく、「もし耳を見ているなら、ぼやけた背景はどのように見えるはずか? もし尻尾を見ているなら、耳はどのように見えるはずか?」と推測するのです。
この論文は、**メタ表現的予測符号化(Meta-Representational Predictive Coding: MPC)**と呼ばれる新しい学習システムを紹介しています。これは、生物学的な脳がどのように学習するか(世界を素早く「一瞥」し、それらの一瞥の異なる部分が互いにどのように関連しているかを予測すること)をコンピュータに教えるために設計されています。しかも、答えを教えてくれる教師を必要としません。
核心的な問題:なぜ現在のAIは「不自然」なのか
著者らは、現代のAIの学習方法における2つの主な問題を指摘しています。
- 教師を必要とする: ほとんどのAIは、人間によるデータのラベル付け(例:「これは猫です」「これは犬です」)を必要とします。
- 「魔法のような」数学を使用している: 学習のために、ネットワークを通じてエラー信号を後ろ方向に送る「バックプロパゲーション(誤差逆伝播法)」という手法を使用しています。生物学的に見ると、人間の脳のニューロンには、このように信号を後ろに送る仕組みはありません。それは、数学のテストを修正するために、教室の後ろにある解答集を見ようとする学生のようなもので、現実には不可能です。
解決策:「懐中電灯」のような脳
著者らは、私たちの目と脳が実際にどのように機能しているかに着想を得たシステムを提案しています。
1. 3つの「ストリーム(流れ)」による視覚
私たちの目は、高解像度の中心部(中心窩)と、ぼやけた周辺部を持っています。MPCモデルは、脳を3つの並列なストリームに分割することでこれを模倣します。
- 中心窩ストリーム(Foveal Stream): 小さく鋭い、詳細なパッチ(猫の目のアップのようなもの)を見ます。
- パラ中心窩ストリーム(Parafoveal Stream): 中程度の大きさで、少しぼやけたパッチを見ます。
- 周辺部ストリーム(Peripheral Stream): 大きく、非常にぼやけた、低詳細なパッチ(猫がいる部屋全体のようなもの)を見ます。
2. 「推測ゲーム」(メタ表現)
画像全体を再構成しようとする(それは困難で計算コストがかかる作業です)代わりに、これら3つのストリームは互いに「推測ゲーム」を行います。
- 比喩: 3人の探偵が、異なる角度から同じ犯罪現場を見ていると考えてください。探偵A(中心窩)は鋭い手がかりを見つけます。探偵B(周辺部)は部屋のぼやけた輪郭を見ています。
- 学習: 探偵Aは、自分の手がかりに基づいて、探偵Bが何を見ているかを推測しようとします。探偵Bは、部屋の形に基づいて、探偵Aが何を見ているかを推測しようとします。
- 結果: 彼らは、その「犯罪(ラベル)」が何であるかを知る必要はありません。ただ、彼らの内部的な推測が一致していればよいのです。もし推測が間違っていれば、彼らは局所的に「シナプス(結合)」を調整します。これが、教師なしでパターンを認識することを学ぶ方法です。
3. 「能動的な探索者」(サッカード)
このモデルは、静止画をただじっと見ているのではありません。それには動く「目」があります。
- 比喩: 迷路を探索するマウスを考えてください。マウスは迷路全体を一度に見ることはできません。数歩進み、角の匂いを嗅ぎ、それから次の場所へと走ります。
- メカニズム: モデルは「サッカード・プランナー(躍動性眼球運動計画器)」という反射システムを使用して、次にどこを見るべきかを決定します。モデルは、混乱を招いている領域や、「驚き(エラー)」が高い領域を探します。もし、説明できないほどぼやけたパッチを見つけた場合、モデルはその特定の場所に鋭い視線を得るために「目」を動かします。これは**能動的知覚(active perception)**と呼ばれます。
実践における仕組み
研究者たちは、手書き数字(MNIST)、日本語文字(K-MNIST)、および3Dのおもちゃの物体(NORB)の画像を用いてこのシステムをテストしました。
- プロセス: モデルは、画像に対して一連の「一瞥(ぎむつ)」を数回(15回から60回程度)行います。
- 学習: 一瞥が行われるたびに、異なるストリーム(鋭い視界 vs ぼやけた視界)が、互いの内部予測を更新していきます。
- 結果: 画像を見た後、モデルは見たものについての単一の「要約コード(潜在表現)」を作成します。
- テスト: その後、単純な分類器にその要約コードを見せ、その物体が何であるかを推測させます。
結果
- 機能する: モデルは物体を非常によく認識することを学習しました。人間のラベルと「不自然な」数学を使用するトップクラスのAIとほぼ同等の性能を発揮しました。
- 効率的である: 非常に少ない例でもうまく学習できました(サンプル効率が高い)。
- 汎用性がある: モデルが日本語文字を学習した場合、再学習することなく英語の数字を認識することができました。モデルは特定の文字だけでなく、線の「形」を学習したのです。
- 「負の例」を必要としない: 多くの現代的なAI手法が、学習のために「良い例」と「悪い例」を比較する必要があるのに対し、このシステムは単に自分自身の内部ストリーム同士を比較します。
まとめ
この論文は、AIがどのように学習すべきかについて、生物学的な脳の仕組みにより近い新しい方法を提示しています。画像のすべてのピクセルを記憶したり、間違いを正すための教師に頼ったりする代わりに、このシステムは「懐中電灯」のアプローチをとります。つまり、画像の異なる部分を素早く能動的に見つめ、高解像度の視覚ストリームと低解像度の視覚ストリームの間で、「他の部分がどのように見えるか」を推測し合うゲームを行うのです。これにより、人間のラベルや生物学的に不可能な数学を用いることなく、自己教師あり学習のみを用いて、世界に対するスマートな理解を構築することができます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。