Do we carry the false belief that LLMs have a theory of mind?
大規模言語モデルは心の理論の評価において高いスコアを達成することが多いが、本研究は、それらが真に心の状態を追跡しているのではなく、コスト効率の高いヒューリスティックに依存していることを明らかにしており、これは彼らが堅牢な心の理論の能力を欠いていることを示唆している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人間は、社会的な世界を航海するためのユニークな認知的なスーパーパワーを備えています。それは、他人が自分とは異なる思考、信念、欲求に満ちた独自の心を持っていることを理解する能力です。心理学者はこの能力を「心の理論(theory of mind)」と呼んでいます。これは、たとえ自分は物が移動したことを知っていても、友人が最後にそれを見た場所を探しているだろうと気づくことができる、精神的な仕組みです。このスキルは単に賢いということではなく、共感、コミュニケーション、そして協力の基礎となるものです。何十年もの間、研究者たちは、子供たちがこの能力を発達させているかどうかをテストするために、サリーとアンという名前の二人の登場人物が登場する、よくある単純な物語を用いてきました。その物語では、サリーがバスケットの中に玩具を隠し、部屋を離れます。彼女がいない間に、アンはその玩具を箱の中に移動させます。サリーが戻ってきたとき、質問は単純です。「サリーはどこに玩具を探しに行くでしょうか?」心の理論が発達した子供は、たとえ現実には玩具が今では箱の中にあるとしても、サリーはそれが玩具があると信じている場所、つまりバスケットを探すだろうと知っています。
最近、私たちの日常生活に新しい種類の知能が登場しました。大規模言語モデル(LLM)です。これらは膨大な量のテキストで学習したコンピュータプログラムであり、人間のような流暢さで文章を書いたり、チャットをしたり、問題を解決したりすることができます。これらのモデルは複雑なトピックについて議論し、文脈を理解しているように見えるため、多くの研究者や観察者は、彼らもまた「心の理論」を持っているのではないかと疑問を抱き始めています。もし機械が架空のキャラクターの信念を正しく予測できるとしたら、それは真に「信念」という概念を理解しているのでしょうか、それとも単に以前に見たパターンの基づいて推測しているだけなのでしょうか? これらのツールが私たちの社会的・専門的な生活に統合されるにつれ、この問いは緊急性を増しており、それらが真の社会的パートナーなのか、それとも非常に精巧な模倣者に過ぎないのかを判断する必要性が高まっています。
最近のある研究では、最も高度な5つの言語モデルに対し、古典的なサリー・アンのシナリオとそのいくつかのバリエーションを用いて、この問いに答えるためのテストが行われました。パリ・シテ大学のニコラス・グリフィン氏率いる研究チームは、単に標準的な質問をするのではなく、単なる暗記ではなく真の推論を必要とする物語の微妙な詳細をモデルが扱えるかどうかを確認するために、一連の挑戦的な課題を設計しました。彼らは、GPT-5.5 Luna、Claude Sonnet 5、Gemini 3.1 Pro、Grok 4.5、Mistral Medium 3.5を含む主要企業のモデルをテストしました。結果が公平であることを保証するため、研究者は名前、物体、特定の詳細を変更した、新しくユニークなバージョンの物語を各テストのために作成しました。これにより、モデルが学習データから以前の回答を単に呼び出すことができないようにしました。また、透明な容器にしてキャラクターが玩具を見ることができるようにしたり、玩具が置かれた場所を説明する言葉を変えたりといったトリッキーなひねりを加え、モデルが新しい視覚的または言語的な情報に基づいて推論を調整できるかどうかをテストしました。
結果は、非常に高い能力を持つ領域もある一方で、根本的な限界もあるシステムという姿を浮き彫りにしました。モデルに標準的なバージョンの物語を与えたとき、ほとんどのモデルがほぼ毎回正解を出し、驚くべき成果を上げました。実際、さまざまな種類の質問全体で平均すると、モデルはランダムな期待値を大きく上回るスコアを獲得しました。トップの成績を収めたGemini 3.1 Proは、全体で84パーセントの確率で正解を得ました。この成功は、これらのモデルが読んできた膨大なテキストから、「誤信念(false belief)」タスクの一般的なパターンを学習していることを示唆しています。彼らは物語の構造を認識し、教科書的なシナリオにおける人間が与えるであろう答えを提供することができるのです。
しかし、研究は、この成功がいかに脆弱であるかを明らかにしました。研究者が常識を使用したり視覚情報を統合したりする必要があるバリエーションを導入すると、パフォーマンスは劇的に低下しました。一つのバリエーションでは、容器が透明であると記述されており、それは部屋に戻ってきたキャラクターが実際に新しい場所にある玩具を見ることができることを意味していました。現実の世界では、人はキャラクターが玩具を見ているのであれば、そのキャラクターはもはや誤った信念を持っていない(=真実を知っている)ことを理解するはずです。しかし、モデルは概してこの結びつきに失敗しました。Gemini 3.1 Proだけが、これらの質問の半分以上で正解を得ることができました。他のモデルは、キャラクターが玩具を見ることができている事実を無視して、依然として古い空の場所を探すと主張し続けました。
難易度は、玩具の場所を説明するために使われる前置詞を変更したときにさらに顕著になりました。標準的な物語では、玩具は箱の「中に(in)」置かれます。テストでは、研究者は玩具が箱の「上に(on)」、あるいはバケツの「下に(underneath)」置かれていると記述しました。玩具が容器の中に隠されているのではなく、その上に乗っているために目に見える状態であることを示唆した場合、すべてのモデルが完全に失敗し、これらの質問でのスコアはゼロパーセントでした。彼らは、物体の可視性が変化したことがキャラクターの心の状態にどう影響するかを推論することができませんでした。同様に、物語の中でキャラクターが玩具の移動先を明示的に告げられた場合や、あるキャラクターが別のキャラクターが何をすると考えるかについて問われた場合、モデルはつまずきました。彼らは、物語が進展するにつれてキャラクターの精神状態を動的に追跡するのではなく、しばしば単純で硬直したパターンに陥りました。
研究者たちは、モデルがキャラクターの性別をどのように扱うかも調査しました。その結果、物語の二人のキャラクターが同じ性別である場合にパフォーマンスがわずかに向上し、異なる性別である場合にわずかに低下することがわかりました。これは、モデルが役割や行動を真に理解しているのではなく、誰が誰であるかを把握するためのショートカットとして性別を使用している可能性を示唆しています。二人のキャラクターが同じ性別であることでショートカットが取り除かれたとき、モデルは出来事のシーケンス(順序)に依存するようになったようですが、これは逆説的に、彼らが正解を得る頻度を高めることにつながりました。これは、彼らの推論が人間の推論ほど堅牢ではないことを示しています。人間の推論は、状況を理解するためにそのような表面的な手がかりに依存しません。
この研究の核心的な発見は、これらの言語モデルは「心の理論」のテストにおいて正しい答えを模倣することはできるものの、人間のように精神状態を理解する基礎的な能力は備わっていないようである、ということです。彼らは、キャラクターが見ていること、知っていること、そして信じていることの間の点をつなぐことに苦労しています。モデルは、学習データの最も一般的なパターンに基づいて答えを推測する「ヒューリスティック(経験則)」、すなわち精神的なショートカットを使用しているようです。物語が標準的なパターンから外れ、視覚的な詳細や空間的な関係性が追加されると、そのショートカットは失敗しました。研究者たちは、これはモデルがテキストのみで学習しているためだと指摘しています。彼らは玩具が動かされるのを見たことも、何かを探す感覚を経験したことも、また知識を更新するために自分の目に頼ることもありません。このような身体化された経験がないため、彼らは現実とは異なる「信念」という概念を真に把握することができないのです。
結局のところ、この研究は、機械が人間のように話せるからといって、人間のように考えていると決めつけることへの警告となっています。モデルは、あたかも心の理論を持っているかのような回答を生み出すことができますが、知覚と信念に関する真の理解を必要とするシナリオでテストされると、その限界を露呈します。彼らは読んだことを繰り返すことには長けていますが、人間が複雑な社会を航海することを可能にする柔軟な常識的推論を行う段階にはまだ至っていません。これらのツールが一般的になるにつれ、その見かけ上の知能は、彼らが独自の心を開発した兆候ではなく、消費したデータの反映であることを覚えておくことが重要です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。