← 最新の論文
🧬 biology

Toward a mechanistic understanding of inference in visual cortex and diffusion models

本論文は、V1水平方向の接続を模倣したペアワイズ相互作用を伴うスパースコーディングに基づく、最小限かつ解釈可能な拡散モデルを提示し、生物学的な知覚推論とブラックボックス型の拡散アーキテクチャの内部動作の両方に対してメカニズム的な洞察を提供しつつ、高性能な画像デノイジングを実現するものである。

原著者: Zeyu Yun, Alexander Belsten, Dasheng Bi, Zahra Kadkhodaie, Yubei Chen, Bruno A. Olshausen

公開日 2026-07-20
📖 1 分で読めます☕ さくっと読める

原著者: Zeyu Yun, Alexander Belsten, Dasheng Bi, Zahra Kadkhodaie, Yubei Chen, Bruno A. Olshausen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

脳の探偵仕事とAIの夢見る機械

あなたは、手がかりが散乱し、ぼやけ、その半分が欠けている中で、ミステリーを解こうとしているところだと想像してみてください。これは、あなたが世界を見ている時に毎回起きていることです。あなたの目は、完璧な写真を撮っているわけではありません。光と影の混じり合った混沌としたものを受け取っています。それを理解するために、脳は探偵のように振る舞い、空白を埋め、完全な図がどのようなものかを推測しなければなりません。このプロセスは「知覚的推論(perceptual inference)」と呼ばれます。何十年もの間、科学者たちは、脳がいかにしてこれほど容易にこれを行っているのかという疑問を抱いてきました。彼らは、視覚野(視覚を司る脳の部分)のニューロンが、見ているものについて合意を得るために互いに話し合う「友人のネットワーク」のように、特定の形でつながっていることを知っています。

同時に、「拡散モデル(diffusion model)」と呼ばれる新しい種類の人工知能が、素晴らしい画像を生み出すことで有名になりました。これらのAIシステムは、純粋な静止ノイズ(古いテレビ画面の砂嵐のようなもの)から始まり、クリアな画像が現れるまでゆっくりとノイズを取り除いていくことで機能します。これらは非常に優れていますが、同時に「ブラックボックス」でもあります。それらが機能することは分かっていますが、その中の数百万もの小さなデジタル・ニューロンが、どのようにして犬や顔の形を決めているのか、私たちは実際には分かっていません。大きな問いは、脳とこれらのAIモデルは、視覚というパズルを解くために同じ秘密のトリックを使っているのだろうか?ということです。もしAIが従っているルールを解明できれば、私たちの脳がどのように機能しているのかをようやく理解できるかもしれません。

この論文の核心的なアイデア:大きな脳を持つシンプルなモデル

この論文は、私たちの脳がどのように見るかと、AIがどのように画像を生成するかとの間の溝を埋めようとする、新しい簡略化されたモデルを紹介しています。著者たち(UCバークレーなどの研究機関のチーム)は、脳における視覚情報の最初の停留所である一次視覚野(V1)を模倣したコンピュータ・プログラムを構築しました。彼らは、解読不可能な巨大で複雑なディープラーニング・ネットワークを使う代わりに、「スパースコーディング(sparse coding)」という概念に基づいた「最小限の」モデルを作成しました。

スパースコーディングを、絵を作るために特定のピースだけを使うパズルのようなものだと考えてください。脳においてこれは、ある画像を表すために、ある特定の時点では少数のニューロンだけが発火することを意味します。著者たちはこのアイデアを取り入れ、そこにひねりを加えました。彼らは、ニューロンが互いに影響を与え合えるように、特定の形で互いに会話(相互作用)できるようにしたのです。標準的なモデルでは、ニューロンはしばしば独立した作業員として扱われます。しかし、この新しいモデルでは、著者たちはニューロンに「ソーシャルネットワーク(相互作用行列)」を与え、互いに影響を与え合えるようにしました。これにより、モデルは、画像の形が一部で上に向かう線であれば、次の部分もその線を継続する可能性が高いことを学習できます。たとえ画像がノイズだらけであったり、壊れていたりしても同様です。

彼らが発見したこと:脳の「ソーシャルネットワーク」

研究者たちがこのモデルを自然な画像(風景や物体などの写真)で訓練したとき、驚くべきことが起こりました。モデルが学習した「ソーシャルネットワーク」は、実際のヒトの脳に見られる物理的な接続と全く同じ形をしていたのです。具体的には、モデルは、似たような角度に調整され、かつ一列に並んでいるニューロン同士の間に強い接続を発達させました。これは「共線的促進(collinear facilitation)」として知られています。

現実の世界において、これが、草むらの中を這う蛇の姿が一部隠れていても、簡単にそれを見ることができる理由です。あなたの脳は点と点を結びつけます。論文は、このモデルも同じことができることを示しています。彼らが壊れた、隠れた輪郭(雲の後ろに消える線のようなもの)を含む画像を見せたとき、モデルは単にランダムに推測したわけではありません。学習した接続を利用して、欠落した線を「補完」し、滑らかで連続的な曲線を作り出したのです。この性能は、巨大で複雑なAIモデルとほぼ同等でしたが、大きな利点がありました。モデルがシンプルであるため、研究者たちは実際にその内部を覗き込み、どのように機能しているかを確認することができたのです。

秘伝のソース:AIはどう「考える」のか

この論文における最もエキサイティングな発見の一つは、モデルがどのように「補完」プロセスを処理するかという点です。著者たちは数学的な分解を行い、モデルが単に推測しているのではなく、池に広がる波紋のように活動を広げていることを示しました。あるニューロンが線の一部を検出すると、それは隣人へと信号を送ります。もしそれらの隣人も活動しており、かつ整列していれば、信号は強まり、そこに線が存在するという考えを強化します。もし隣人が整列していなかったり、活動していなければ、信号は遮断されます。

論文は、このプロセスが、モデルには一層しかないにもかかわらず「階層」を作り出していることを示唆しています。モデル内のニューロンの約30%が、直接的な視覚入力から完全に切り離されることを学習しました。これらの「切り離されたニューロン」は、第二の隠れた層として機能し、モデルが全体像を理解するのを助けます。彼らはピクセルを見るのではなく、顔の両目が互いに対して正しい位置にあることを確認するといった、グローバルなルールを強制する役割を果たします。これは、モデルが、例の顔を一度も見学したことがなくても、リアリスティックな新しい顔全体を生成できる理由を説明しています。それは暗記しているのではなく、顔の幾何学を理解しているのです。

なぜこれが重要なのか:AIから生物学へ

この論文は、現代の複雑で謎めいた挙動を示すAI拡散モデルの背後にあるのは、実は私たちの視覚野に見られるような、シンプルで生物学的な原理によって駆動されている可能性があることを示唆しています。「ブラックボックス」であるディープラーニングは、著者たちが構築したシンプルな再帰回路の、非常に複雑なバージョンに過ぎないのかもしれません。

単純で解釈可能なモデルが、巨大なAIシステムの性能に匹каマッチすることを示すことで、著者たちは脳を研究するための新しい方法を提示しています。彼らは、視覚システムが曖昧さを解消するためにこれらの特定の接続を使用し、ノイズが多く混乱した世界を、明確で一貫した絵へと変えているのだと提案しています。これは単なる理論ではありません。モデルが、異なる種類のノイズに対してニューロンがどのように反応すべきかという予測は、実際の生物学的な脳における最近の実験とも一致しています。

要約すると、この論文は、見ることも、芸術を生み出すことも、その秘密は同じである可能性を示唆しています。それは、局所的な手がかりが繋がり、グローバルな物語を形成することを可能にする、シンプルな一連のルールです。あなたの脳の中のニューロンであれ、AIの中のデジタルの重みであれ、目標は混沌の中にパターンを見つけ出すことです。そして今、このモデルのおかげで、私たちはそのパターンがいかにして立ち現れるのかについての、より明確な地図を手にしているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →