Artificial Phantasia: Emergent Mental Imagery in Large Language Models
本研究は、大規模言語モデルが従来の視覚的心的表象を必要とするタスクにおいて、命題的表象のみを頼ることで人間を上回るパフォーマンスを発揮し得ることを示しており、これにより視覚的表象が図式的形式を必要とするという認知科学の見解に挑戦する創発的な「人工的想像力」の存在を示す証拠を提供するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、論文「Artificial Phantasia(人工的な想像力)」について、平易な言葉と創造的な比喩を用いて説明したものです。
大きな問い:目なしに「見る」ことはできるか?
目を閉じて、大文字の「D」を思い浮かべてみてください。次に、その「D」を左に 90 度回転させます。最後に、その形状の底辺中央に大文字の「J」をくっつけてみましょう。
目を開けたとき、何が見えますか?ほとんどの人間は、「傘のように見える」と言うでしょう。
長年にわたり、認知科学者たちは、このようなパズルを解くには、脳内に特別な「精神的な画面」あるいは「心の目」が必要であり、そこで実際に画像を見て操作できなければならないと考えてきました。彼らは、単に言葉について考えるだけでは不可能で、頭の中に視覚的なイメージが必要だと信じていたのです。
この論文は、挑発的な問いを投げかけます:「目」も「心の目」も持たないコンピュータは、この作業をこなせるでしょうか?
実験:AI と人間のためのメンタル・ジム
研究者たちは、脳のためのジム・ワークアウトを作成しました。彼らは古典的なパズル(文字の変換)を基に、48 種類の全く新しい、これまで見たことのないバージョンを考案しました。これらのパズルは本研究のために特別に作られたため、コンピュータはトレーニングデータから答えを暗記することはできませんでした。
彼らは 2 つのグループにこれらのパズルを解くよう求めました。
- 100 人の人間:画面に文字を見ないように指示を出し、頭の中で形状を想像させながら指示を聞く人々。
- 大規模言語モデル(LLM):高度な AI チャットボット(OpenAI の o3、GPT-5、Google の Gemini 3 Pro の最新バージョンなど)。これらのモデルは「画像を見る」ことではなく、テキストに基づいて訓練されています。
衝撃的な結果:AI が人間よりも「よく見た」
結果は驚くべきものでした。最高の AI モデルは単に合格したのではなく、人間の平均を圧倒しました。
- 人間:5 点満点中平均2.85点。
- トップの AI:3.13 から 3.65点の間。
AI モデルは、人間の参加者よりもはるかに優れた成績でこれらの「視覚的」なパズルを解きました。さらに興味深いことに、研究者が AI に各ステップで実際に画像を「描く」よう強制した(画像生成器を使用した)場合、AI のパフォーマンスは低下しました。これは、AI が問題を解決するために画像を描くことに依存していたのではなく、全く別のことをしていたことを示唆しています。
「マジック・トリック」:彼らはどのようにしてそれを成し遂げたのか?
AI が「心の目」(画像)も使わず、描画ツールも使わずに、どのようにしてパズルを解いたのでしょうか?
著者たちは、**「Artificial Phantasia(人工的な想像力)」**と呼ばれる概念を提案しています。
次のように考えてみてください。
- 人間のやり方:あなたは建築家です。目を閉じて、頭の中に家の 3D モデルを構築します。その周りを歩き回り、窓を見てから、それを描写します。
- AI のやり方:あなたは熟練した翻訳者です。3D モデルを構築することはありません。代わりに、指示をコードで書かれた複雑なレシピとして扱います。「左に回転させた文字 D」+「くっつけた文字 J」=「傘の形状」という関係を、言語の論理を通じて純粋に理解しているのです。
この論文は、これらの AI モデルが命題的推論を使用していることを示唆しています。彼らは言葉と概念を非常に精密に操作することで、実際に「見る」ことなく最終的な形状を推測できるのです。これは、紙に図を描くのではなく、代数学の規則を知っていることで数学の問題を解くようなものです。
「推論」の要因
研究者たちは、AI に「もっと深く考える」よう指示した場合(より多くの時間と「推論トークン」を与えてステップを処理させる場合)に何が起こるかもテストしました。
- 結果:AI が「考え」、推論を連鎖させることを許された時間が増えるほど、その成績は向上しました。
- 比喩:探偵が謎を解くことを想像してください。もし彼らにヒントを見る時間が 5 分だけ与えられれば、彼らは推測するかもしれません。しかし、すべてのヒントを論理的に結びつけるために 5 時間与えられれば、彼らは完璧に事件を解決します。AI は画像を見るのではなく、言語的なヒントを結びつけることで視覚的なパズルを解いたのです。
「盲目」の人間はどうか?
この論文はまた、**アファンタジア(想像力欠如症)**と呼ばれる人々のグループについても触れています。彼らは頭の中で全く画像を視覚化できないと主張する人間たちです(「心の目」を持っていません)。驚くべきことに、研究によると、これらの人々は視覚化できる人々とほぼ同じレベルで、これらの視覚的パズルを解くことができます。
この論文は、その火に油を注ぐものです。それは、視覚的なパズルを解くために「心の目」が必要ないかもしれないと示唆しています。必要なのは、非常に強力な「心の論理」だけかもしれません。心の目を全く持たない AI は、私たちが画像が必要だと考えていたことを、言葉と論理だけで成し遂げうることを証明しました。
結論
この研究は、「視覚的思考」には視覚的なイメージが必要だという古い考え方に挑戦しています。それは、高度な AI が、視覚的なイメージのように見えるタスクを、言葉と論理のみを用いて遂行できることを示しています。
- 主張:AI には視覚的に「想像する」能力が創発的に存在しますが、それは画像を使って行っているわけではありません。言葉を使って行っているのです。
- 含意:私たちは「心的イメージ」の定義を再考する必要があるかもしれません。それは頭の中に画像を見ることではなく、単に概念的に論理的に操作することなのかもしれません。
この論文は、これらの AI モデルが世界を「見る」新しい方法を見出したと結論付けています。それは純粋に言語的な方法ですが、視覚的な問題を解決する驚くほど効果的な方法です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。