← 最新の論文
💻 computer science

Do vision models perceive illusory motion in static images like humans?

この論文は、静止画における錯覚運動(回転するヘビ錯覚)の知覚を評価した結果、現在のオプティカルフローモデルの多くは人間の知覚を再現できず、サッケード運動のシミュレーション下で人間に似た挙動を示すのは双チャンネルモデルのみであり、そのためには輝度および高次色特徴に基づく運動信号と再帰的注意機構の統合が不可欠であることを明らかにしました。

原著者: Isabella Elaine Rosario (Columbia University), Fan L. Cheng (Columbia University), Zitang Sun (Kyoto University), Nikolaus Kriegeskorte (Columbia University)

公開日 2026-04-15
📖 1 分で読めます☕ さくっと読める

原著者: Isabella Elaine Rosario (Columbia University), Fan L. Cheng (Columbia University), Zitang Sun (Kyoto University), Nikolaus Kriegeskorte (Columbia University)

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

1. 実験の舞台:「回転するヘビ」のトリック

まず、実験で使われた画像は**「回転するヘビ(Rotating Snakes)」**という有名な錯覚画像です。

  • 人間が見ると: 静止しているはずの画像が、じわじわと回転しているように見えます。
  • AI(従来のモデル)が見ると: 「動いていない」と判断します。あるいは、画像が少しズレただけの動きしか検出できません。

研究者たちは、「なぜ AI はこの『見えない動き』を見逃してしまうのか?」を突き止めたいと考えました。

2. 実験方法:AI に「目の動き」をシミュレートする

人間の目は、じっとしているように見えても、実は常に微細に震えていたり(微視的サッケード)、大きく動かしたり(サッケード)しています。この「目の動き」が、静止画を「動いているように見せる」鍵です。

そこで研究者たちは、AI に以下の 3 つの状況で画像を見せました。

  1. 静止状態: 画像をピタリと固定して見せる。
  2. 出現時: 突然画像が現れる瞬間を見せる。
  3. 目の動き: 画像を少しずらす(人間の目が動くのをシミュレート)。

3. 実験結果:AI の「目」は人間と違う

結果は衝撃的でした。

  • 従来の AI(PWC-Net や RAFT など):
    これらは「自動運転」や「動画編集」で非常に優秀な AI です。しかし、この錯覚画像に対しては**「動いていない」と判断するか、単に「画像がズレた方向」しか検出できませんでした。まるで、「静止画を見ているカメラ」**のようです。

  • 唯一の例外:「Dual(デュアル)」という AI
    脳科学の仕組みを真似て作られた「Dual」というモデルだけが、**「少しだけ、人間と同じように回転しているように見える」**という反応を示しました。
    ただし、人間の「スムーズで連続した回転感」にはまだ遠く及ばず、まだ「断片的な動き」に過ぎません。

4. なぜ「Dual」だけが成功したのか?(秘密のレシピ)

なぜ他の AI はダメで、Dual だけが少し成功したのか?その理由を「料理」に例えてみましょう。

  • 従来の AI:
    「明るさの変化」だけを頼りに動く方向を計算する、**「単一の味付け」**の料理です。錯覚画像の微妙な色の配置(明るさの非対称性)を捉えきれません。
  • Dual のレシピ:
    1. 第一の味(一次元): 明るさの変化を捉える。
    2. 第二の味(高次元): 色の組み合わせや複雑なパターンを捉える。
    3. 熟成(再帰的統合): 一度見た情報を、時間をかけて脳内で「反芻(はんすう)」して統合する。

この**「複数の感覚を組み合わせ、時間をかけて熟成させる」**という仕組みがあるからこそ、Dual は「動いている」という錯覚を少しだけ再現できたのです。

5. この研究が教えてくれること

この研究は、**「AI をもっと人間らしくするには、単に『正解』を覚えるだけでなく、人間の『目の動き』や『脳の処理プロセス』を真似る必要がある」**と示唆しています。

  • 自動運転やロボットの未来:
    今の AI は、人間の目が「動いている」と感じる微妙な状況(例えば、霧の中の看板や、複雑な模様の壁)で失敗しやすい可能性があります。
  • 人間の脳の謎:
    AI を実験台にすることで、「なぜ人間は静止画を動かして見えてしまうのか」という脳の仕組みが、より深く理解できるようになりました。

まとめ

この論文は、**「AI はまだ、人間の『見方』を完全に真似できていない」と告白しつつも、「脳の仕組みを真似した『Dual』という AI が、その第一歩を踏み出した」**と報告しています。

まるで、**「人間は魔法のように静止画を動かして見ているが、AI はまだその魔法の呪文(脳の仕組み)を完全に解読できていない」**という物語です。しかし、Dual というモデルの登場は、その呪文の解読が着実に進んでいることを示す明るい兆しです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →