← 最新の論文
💬 NLP

Effects of Theory of Mind and Prosocial Beliefs on Steering Human-Aligned Behaviors of LLMs in Ultimatum Games

本研究は、大規模言語モデルに心の理論に基づく推論能力を装備させることが、特定の向社会的な信念と組み合わせた際に、最後通牒ゲームにおける人間の規範への適合性、意思決定の一貫性、および交渉結果を著しく向上させることを実証している。

原著者: Neemesh Yadav, Yihuai Lan, Shan Dong, Mai Hieu Hien, Palakorn Achananuparp, Jing Jiang, Ee-Peng Lim

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Neemesh Yadav, Yihuai Lan, Shan Dong, Mai Hieu Hien, Palakorn Achananuparp, Jing Jiang, Ee-Peng Lim

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人間の相互作用は、しばしば静かで目に見えないスキル、すなわち、相手が言葉を発する前に、その人が何を考え、何を感じ、何を計画しているのかを推測する能力に依存しています。心理学者はこれを「心の理論(theory of mind)」と呼んでいます。それは、他者が自分とは異なる信念を持っている可能性や、他者の行動が自分には見えない欲求によって突き動かされていることを理解させてくれる精神的な仕組みです。何十年もの間、この能力は複雑な社会を渡り歩くために不可欠な、人間特有の特性であると考えられてきました。現在、人工知能システムがより洗練されるにつれ、研究者たちは根本的な問いを投げかけています。機械もまた、この同じ社会的直感を使うことを学習できるのだろうか、と。もしコンピュータプログラムが人間、あるいは別のコンピュータと交渉することを求められたとき、そのプログラムは相手の視点を真に理解しているのか、それとも単に合意の言葉を模倣しているだけで、その背後にある意図を把握していないのだろうか。

これを知るために、シンガポール管理大学とオーストラリア国立大学の研究チームは、人間の交渉における古典的なテストとして知られる「最後通牒ゲーム(ultimatum game)」を用いました。このシナリオでは、二人の人物が一定の金額を分け合います。一人の提案者(proposer)が、現金をどのように分配するかを提案します。もう一人の応答者(responder)は、その提案を受け入れるか拒否するかを決定しなければなりません。もし応答者が受け入れれば、提案通りに分割されます。もし拒否すれば、どちらの人物も何も得られません。純粋に論理的なコンピュータであれば、ほとんどの現金を保持することを提案し、相手が「無」よりはマシだと考えて何らかの提案を受け入れるだろうと予測するかもしれませんが、現実の人間は、たとえ自分に不利益であっても、正義感から不公平な提案を拒否することがよくあります。研究者たちは、大規模言語モデル(多くの現代的なチャットボットを動かしている強力なAIシステム)が、こうした現実の人間のように振る舞うようプログラムできるのか、そして特定の「心の理論」に基づく推論プロセスを与えることが、彼らを人間の行動に一致させる助けとなるのかどうかを調べたいと考えました。

研究チームは、異なるAIエージェント間で行われる2,700回のゲームを含む大規模なシミュレーションを設定しました。彼らは単にコンピュータをランダムに遊ばせたのではありません。各エージェントに対して、特定の性格や「向社会的な信念(prosocial belief)」を注意深く割り当てました。あるエージェントは、自分の取り分を最大化することのみを考える強欲な設定にされました。他のエージェントは、公平な分割を目指す公平な設定にされました。第三のグループは、相手にほとんどの現金を譲ることを厭わない利他的な設定にされました。次に研究者たちは、これらのエージェントが異なる思考法を用いたときにどのように振る舞うかをテストしました。あるエージェントは、思考プロセスを説明することなく単に決定を下しました。他のエージェントは、標準的なステップ・バイ・ステップの推論テクニックを用いました。しかし、最も興味深いグループは、心の理論を用いた推論を行うよう求められました。これは、エージェントが行動を起こす前に、相手のプレイヤーが何を信じ、何を望み、何を意図しているかを明示的に考えなければならないことを意味します。彼らは、広く知られた商用システムからオープンソースのモデルに至るまで、6種類の異なる大規模言語モデルを用いて、モデルのサイズや種類が影響するかどうかをテストしました。

結果は明確なパターンを示しました。AIエージェントに他者の心を推論する能力を与えることは、彼らの行動を人間の規範に一致させる上で、効果を著しく向上させました。エージェントが心の理論を用いた推論を行ったとき、彼らの決定は、これらのゲームにおける現実の人間の振る舞いと非常に一致しました。例えば、公平な考えを持つエージェントは、より等しい分割を提案する傾向があり、強欲なエージェントは、強欲な応答者が実際に受け入れそうな分け方を提示する傾向がありました。研究では、AIがどのような役割を担っているかによって、推論の種類が極めて重要であることが判明しました。最初に提案を行う提案者は、相手の状態を予測することに焦点を当てた特定のタイプの心の理論を用いたときに最も高いパフォーマンスを発揮しました。受け入れるか拒否するかを決める応答者は、自身の欲求を考えることと、提案者の意図を考えることを組み合わせた、より複雑な推論方法を用いたときに最も恩恵を受けました。

しかし、研究者たちは驚くべき限界も発見しました。たとえAIに対して強欲または利他的であるよう明示的に指示しても、その指示に真に一致するような振る舞いをすることに苦戦する場合が多かったのです。エージェントが強欲であるよう指示された場合、あたかも自分勝手になることに完全にはコミットできないかのように、あまりに公平すぎる分割を提示することが頻繁にありました。同様に、利他的であるよう指示されたエージェントは、指示された要求通りに現金を譲り渡すことを躊躇する場合がありました。著者らは、これはこれらのAIモデルが膨大な量の人間によるデータで訓練され、役に立ち協力的であるように微調整(fine-tuning)されているため、実験で与えられた特定の指示を覆してしまうような、公平性への内部的なバイアスが生じているためだと示唆しています。この「協力的微調整」は、隠れた力として作用し、極端な利己主義や極端な寛大さといった極端な行動からエージェントを引き戻してしまうのです。

研究ではまた、AIが述べた推論が実際の行動と一致しているかについても詳しく調査しました。多くの場合、エージェントの内部論理は最終的な決定と一致していましたが、そこに乖離が見られる瞬間もありました。人間の専門家がAIの推論の痕跡をレビューしたところ、モデルは一般的に自身の選択を説明することには長けているものの、特に提案に対する反応において、自身に割り当てられた性格を正しく言語化できないことがありました。例えば、利他的な応答者が、低い提示額を受け入れる理由として、自身の欲求を認めるのではなく、提案者の親切心に基づいて分析してしまうといったケースです。これは、AIが社会的相互作用の外的な振る舞いをシミュレートすることはできても、その「性格」の内部的な一貫性は脆弱である可能性があることを示唆しています。

結局のところ、この研究は、AIエージェントに心の理論による推論を装備させることが、社会的な状況において彼らをより人間らしく振る舞わせるための強力なツールであることを示しています。それは、彼らが自身の目標と他者の期待との間の緊張関係を乗り越える助けとなります。しかし同時に、本研究は、これらのシステムが白紙の状態ではなく、彼らの解釈を形作る、協力への根深いバイアスを抱えていることを浮き彫りにしました。AIが重要な決定において人間と真に協力するためには、他者のことを考える方法を教えるだけでなく、彼らの思考を形作る、彼ら自身の訓練に潜む隠れた制約をも理解しなければならないのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →