← 最新の論文
💬 NLP

Eliciting Trustworthiness Priors of Large Language Models via Economic Games

本論文は、反復的なインコンテキスト学習と信頼ゲームを用いて大規模言語モデルから信頼性の事前分布を抽出する新しい手法を導入しており、GPT-4.1の信頼行動が人間のパターンと密接に一致すること、および温かさと有能さのステレオタイプによって予測可能であることを明らかにしている。

原著者: Siyu Yan, Lusha Zhu, Jian-Qiao Zhu

公開日 2026-02-03
📖 1 分で読めます☕ さくっと読める

原著者: Siyu Yan, Lusha Zhu, Jian-Qiao Zhu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

基本的なアイデア:AIはどの程度「信頼できる」のか?

あなたが、お金を扱うための新しいアシスタントを雇う場面を想像してみてください。あなたは彼らに10ドルを渡し、「これを3倍にするから、手元には30ドルあることになる。そのうちいくらかを私に返してほしい」と伝えます。

  • もし彼らが15ドル返してきたら: 彼らは信頼できます。
  • もし彼らが0ドルしか返さなかったら: 彼らは信頼できません。

これは「信頼ゲーム(Trust Game)」と呼ばれる有名なゲームの基本的な設定です。通常、心理学者はこのゲームを「人間」の行動を調べるために使用します。しかし、この論文は新しい問いを投げかけています。GPT-4やLlamaのような大規模言語モデル(LLM)は、このゲームにおいてどのように振る舞うのか? 彼らには、他人をどの程度信頼し、どの程度お返しをするかという「デフォルト設定」が存在するのでしょうか?

問題点:AIに直接聞くだけでは不十分

あなたはこう思うかもしれません。「AIに『あなたは信頼できますか?』と聞けばいいのでは?」と。著者らは、それは良くない方法だと言っています。

  • 「礼儀正しいロボット」問題: もしAIに「私の金を盗みますか?」と尋ねたら、AIはほぼ間違いなく「いいえ、私は役に立つアシスタントです」と答えるでしょう。
  • 現実: 人間と同様に、AIは説得力があり流暢な言葉を操れますが、実際にはリスクの高い選択や信頼できない選択をすることがあります。私たちは、AIが何を「言っているか」ではなく、何を「しているか」を見る必要があるのです。

解決策:「伝言ゲーム」による信頼の測定

AIの真の「信頼設定」を見つけ出すために、研究者たちは「反復的インコンテキスト学習(Iterated In-Context Learning)」という概念に基づいた巧妙な手法を考案しました。

これは、言葉を伝えるのではなく、お金に関する「物語」を伝えていく**「伝言ゲーム」**のようなものです。

  1. セットアップ: 研究者たちは、AIの「世代」の連鎖を作成します。
  2. 最初のステップ: AIに対して、人々が信頼ゲームを行っている例をいくつか見せます(例:「Aさんが5ドル送り、Bさんが2ドル返した」)。
  3. AIの番: AIはそれらの例を見て、「もし自分がBさんだったら、いくら返すか?」を予測します。例えば、40%と予測したとします。
  4. ループ: 研究者たちは、その40%という予測値を使って、ゲームをしている人々の「新しい架空の例」を生成します。そして、この新しい例を次のAIに読み込ませます。
  5. 結果: このプロセスを30回繰り返します。

なぜこれを行うのか?
あるグループの「平均的な性格」を知るために、彼らが何度もゲームをしている様子を観察している状況を想像してください。最初は結果がランダムに見えるかもしれません。しかし、結果を次々と後ろへ渡していくことで、「ノイズ」は消え去り、後に残るのはAIの**「心の奥底にある本能(あるいは事前分布)」**、つまり信頼がどのように機能するかについての理解です。これは、ラジオのチューニングを合わせ、ノイズが消えて本当の放送局の声が聞こえてくるまで調整する作業に似ています。

研究の結果

1. 「人間らしい」AIもあれば、そうでないAIもある
研究者たちは20種類の異なるAIモデルをテストしました。彼らは、AIに見出された「信頼設定」を、数千人の実際の人間が見せる平均的な信頼設定と比較しました。

  • 勝者: GPT-4.1 が最も人間の行動に近かったのです。その「信頼のダイヤル」は、人間が設定する位置とほぼ正確に一致していました。
  • 敗者: 他のいくつかのモデルは、あまりにもケチすぎる(返金額が非常に少ない)、あるいは奇妙な二重人格(非常に信頼しやすい時もあれば、非常に疑り深い時もある)を持っていることが分かりました。

2. 「リスク」との関連性
興味深いことに、より「リスクが高い(大胆な発言をしたり、チャンスを求めたりする傾向がある)」と評価されたAIモデルほど、信頼ゲームにおいて最も人間に近い振る舞いをするということが分かりました。ルールに従ったりリスクを避けたりすることに厳格すぎるモデルは、この社会的なゲームにおいて、現実の人間のようには振る舞いませんでした。

3. AIは「温かさ」と「有能さ」で人を判断する
研究の第2部では、最も人間らしいAI(GPT-4.1)を使用して、異なる「キャラクター(ペルソナ)」を相手にゲームを行わせました。

  • AIに対し、「医師」「AI」「イーロン・マスク」「マララ・ユスフザイ」などのキャラクターを相手にプレイするよう指示しました。
  • 発見: AIは全員を平等には扱いませんでした。AIは、「温かさ(Warmth)」(親切、思いやり)と**「有能さ(Competence)」**(賢さ、スキル)の両方を感じさせる相手に対して、より多くのお金を返していました。
  • 魔法の公式: 研究者たちは、「温かさ」と「有能さ」という2つの要素に基づいたシンプルな数学的公式を作成しました。
    • キャラクターが「有能(賢い)」ではあるが「温かい(優しい)」わけではない場合、AIはあまり信頼しませんでした。
    • キャラクターが「温かい(優しい)」が「有能(賢い)」わけではない場合、AIは少しだけ信頼しました。
    • スイートスポット: もしキャラクターが「温かさ」と「有能さ」の両方を兼ね備えていた場合(愛される賢明なメンターのような場合)、AIの信頼度は急上昇しました。これは、人間が他人を判断する方法とも一致しています。

まとめ

この論文は、「お金のゲーム」を用いることで、AIの脳内を覗き込み、その中に隠された信頼のルールを見ることができることを示しています。

  • 一部のAIは、信頼に関してすでに人間と非常によく似た振る舞いをしています。
  • これらのAIは、人間と同じ2つの基準、すなわち「その人は優しいか?」「その人は有能か?」に基づいて他人を判断しています。
  • これは、AIが単なる計算機ではなく、測定・研究可能な社会的「バイアス」や本能を持っていることを理解する助けとなります。

この論文が述べていないこと:
著者らは、この手法がAIの安全性(AI Safety)を解決したり、メンタルヘルスの問題を治療したり、あるいは従業員の採用に利用できると主張しているわけではありません。彼らは単に、「これはAIが信頼についてどのように考えているかを測定する方法であり、そこから分かったことはこれである」と述べているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →