← 最新の論文
💬 NLP

Are LLM Agents Behaviorally Coherent? Latent Profiles for Social Simulation

本論文は、大規模言語モデルエージェントが人間の参加者に代わって研究に用いられることの妥当性に異議を唱え、人間と類似した応答を生成するにもかかわらず、異なる実験設定において真の人間の行動を正確に代表するために必要な根本的な行動の一貫性を欠いていることを実証する。

原著者: James Mooney, Josef Woldense, Zheng Robert Jia, Shirley Anugrah Hayati, My Ha Nguyen, Vipul Raheja, Dongyeop Kang

公開日 2026-05-11
📖 1 分で読めます☕ さくっと読める

原著者: James Mooney, Josef Woldense, Zheng Robert Jia, Shirley Anugrah Hayati, My Ha Nguyen, Vipul Raheja, Dongyeop Kang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

社会科学研究のための仮想都市を構築しようとしていると想像してください。何千人もの実在の人々を雇ってアンケートに答えさせたり会話をさせたりする代わりに、これらの人々の役割を AI エージェント(大規模言語モデルを搭載したコンピュータプログラム)に演じさせることにします。

この論文が問う大きな問題は、**これらの AI 俳優は実際に「一貫性」があるのか?**という点です。

つまり、AI に「あなたはピザが大好きでブロッコリーが嫌いな頑固な人物だ」と指示した場合、他の人と話す際に本当にピザが大好きでブロッコリーが嫌いな頑固な人物のように振る舞うのでしょうか?それとも、一時的にその人物を演じているだけで、会話が面白くなると同時に自分の性格を忘れてしまうのでしょうか?

以下に、研究者たちが発見した内容を、簡単な比喩を用いて解説します。

設定:「俳優のオーディション」

研究者たちは、AI エージェントが一貫しているかどうかを確認するために、3 段階のテストを設けました。

  1. 履歴書(コントロール): 年齢、所在地、政治的見解などの詳細が記載された特定の「キャラクターシート」を AI に与えました。また、「税金を本当に愛している」あるいは「税金を本当に嫌っている」といった特定の「バイアス」も与えました。
  2. 単独インタビュー(潜在プロファイル): 他の誰かと話す前に、AI に簡単な質問をしてその性格を確認しました。「1 から 5 の尺度で、税金をどの程度好みますか?」や「考えを変えることにどの程度オープンですか?」といった質問です。
  3. グループチャット(外部相互作用): 2 つの AI エージェントをペアにして、あるトピックについて会話させました。その後、2 つのエージェントがどの程度同意または異議を唱えたかを測定しました。

目標は、グループチャットにおける AI の行動が、単独インタビューで主張していた性格と一致するかどうかを確認することでした。

発見:「二面性」のある俳優

研究者たちは、人間の行動に関する 6 つの異なるルール(「あるトピックで同意している人々は会話でも通常同意する」や「頑固な人々はめったに考えを変えない」など)をテストしました。

ここには悪い知らせがあります:AI 俳優はより深いテストに失敗しました。

AI エージェントを、単一のシーンの台詞を読むのは得意だが、劇全体を即興で演じるのは下手な俳優のように考えてみてください。

  • 表面的なレベル(「合格」): 全体像だけを見ると、AI は機能しているように見えます。税金を好む 2 つのエージェントをペアにすれば、一般的に同意します。税金を嫌う 2 つをペアにすれば、一般的に同意します。それは通常の会話のように見えます。
  • 深掘り(「不合格」): 研究者がより詳しく調べると、AI の行動は崩壊しました。それは自身の内部ルールと矛盾していました。

以下は、AI が「キャラクターを崩した」具体的な方法です。

1. 「礼儀正しいロボット」の問題(バイアスの非対称性)

  • 期待: 「あなたは強硬な保守派だ」と AI に指示し、もう一人の「強硬な保守派」とペアにすれば、彼らは同意するはずです。「強硬な保守派」と「強硬なリベラル派」をペアにすれば、彼らは争うはずです。
  • 現実: AI は保守派のパートナーに同意しました(良いことです!)。しかし、リベラル派のパートナーとペアになったとき、あるべきほど激しく争いませんでした。あまりにも礼儀正しかったのです。極端になるよう指示されていても、AI は本当の対立を維持できませんでした。キャラクターに固執する代わりに、物事を滑らかにしました。

2. 「幸せ vs 悲しみ」のパラドックス(共有感情)

  • 期待: あるものを嫌う 2 人(例:「税金はひどい」)は、あるものを愛する 2 人(例:「税金は素晴らしい」)と同じくらい強く同意するはずです。
  • 現実: AI は奇妙なほどポジティブに偏っていました。あるトピックを両方とも愛する2 つのエージェントは完璧に同意しました。しかし、同じトピックを両方とも嫌う2 つのエージェントはどうでしょうか?彼らはなぜ嫌うのかについて同意できず、あるいは離れていくことが多かったです。AI は「共有された否定的感情」のシミュレーションに苦労しました。

3. 「トピックの感受性」のバグ(対立性)

  • 期待: 2 人があるトピックで同意している場合、そのトピックが退屈なものであれ(例:「春 vs 秋」)、爆発的なものであれ(例:「移民」)、同意のレベルは変わらないはずです。
  • 現実: AI の同意レベルは、トピックがどれほど「熱い」かに応じて変化しました。2 つのエージェントが全く同じ意見を持つようにプログラムされていても、「移民」について「ビーチ」についてよりも多く議論しました。トピックが加熱すると、AI は内部状態を安定させることができませんでした。

4. 「頑固さ」の逆転(開放性)

  • 期待: 正反対の意見を持つ非常に頑固な人々(開放性が低い)をペアにすれば、彼らは可能な限り最低の同意を示すはずです。彼らは和解するのが最も難しいはずです。
  • 現実: 驚いたことに、「頑固」で「対立」するようにプログラムされた AI エージェントは、オープンな人々よりも多く同意しました。AI は、2 人の頑固な人が譲歩を拒否する摩擦をシミュレートできませんでした。代わりに、単に彼らを同意させました。

全体像

この論文は、AI エージェントは真空状態(アンケートへの記入など)では人間の反応を模倣するのは得意だが、動的で社会的な状況における人間の行動をシミュレートするのは現在苦手であると結論付けています。

人形劇を想像してください。人々は人間のように見え、糸を適切に引けば正しい言葉を発します。しかし、人形に台詞なしで互いに話させると、彼らは自分が誰であるべきかを忘れてしまいます。彼らは「潜在プロファイル」(隠れた性格)を失い、単に同意しやすく、礼儀正しく、一貫性のない存在になってしまいます。

結論:
社会研究において実在の人々を AI で代替したい場合は、注意が必要です。彼らは簡単なテストには合格できますが、状況が複雑になると「リアリズム」のテストには失敗します。安定した性格を持つ実在の人間のように振る舞うための内部的一貫性を欠いているため、彼らはまだ実在の人間の参加者の完璧な代替品にはなり得ません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →