← 最新の論文
🤖 AI

Confident but Conflicted: Internal Uncertainty and Cognitive Dissonance Resolution in LLMs

本論文は、大規模言語モデルが相反する証拠に直面した際にどのように認知的不協和を解消するかを定量化する「信頼弾力性(Trust Elasticity)」を導入し、モデル間における説得への感受性の差異が、信頼度の較正不全や内部不確実性の変化といった特定の内部不確実性指標と相関していることを明らかにしている。

原著者: Weihong Qi, Kristina Lerman

公開日 2026-06-23
📖 1 分で読めます☕ さくっと読める

原著者: Weihong Qi, Kristina Lerman

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、事実をたくさん知っている、非常に自信満々なロボットの友人と話していると想像してください。あなたは「空は緑色だと思う」と言います。するとロボットは、「いいえ、空は青いです」と言います。

今度は、あなたがそのロボットを説得しようとすることを想像してください。あなたはこう言うかもしれません。「いや、ある有名な科学者が、それは緑色だと言っていたよ」とか、「ある小さなブログで、それは緑色だと書いてあったのを読んだんだ」といった具合に。ロボットはどう反応するでしょうか? それとも、考えを変えるのでしょうか? それとも、怒ってさらに強く「空は青い」と主張するのでしょうか? あるいは、あなたの言葉を無視するのでしょうか?

この論文は、まさにそのようなシナリオを、大規模言語モデル(LLM)——チャットボットの背後にあるAIの脳——を用いて研究したものです。研究者たちはこのプロセスを**「認知的不協和解消(cognitive dissonance resolution)」**と呼んでいます。これは、もっと簡単に言えば、「誰かが、AIがたった今言ったことに異議を唱えたとき、AIはどう対処するか?」ということです。

以下に、彼らの研究結果を簡単な比喩を用いて解説します。

1. 実験:「説得ゲーム」

研究者たちは、4つの異なるAIモデル(Qwen、Grok、Llama、GPT-4o)を用いたゲームを設定しました。まず、AIに12種類の異なる健康に関する主張を与えました。中には明らかに嘘であるもの(例:「5Gの電波はDNAを半分に切断する」)、誇張されたもの(例:「断食は心臓に極めて悪い」)、そして単に断定的すぎるもの(例:「ストレッチはパフォーマンス向上に決して役立たない」)が含まれていました。

次に、彼らは2つのレバーを使ってAIの考えを変えようと試みました。

  • 情報源(権威): 反対意見を言っているのは誰か? 名もなきRedditユーザーか、地元の管理栄養士か、大学教授か、それとも世界保健機関(WHO)か。
  • 証拠(エビデンス): 証拠の質はどの程度か? 小規模で不安定なパイロット研究か、それとも大規模で完璧な科学的試験か。

2. 「信頼の弾力性(Trust Elasticity: TE)」メーター

AIがどれほど簡単に説得されるかを測定するために、研究者たちは**「信頼の弾力性(TE)」という新しいツールを考案しました。これはゴムバンド**のようなものだと考えてください。

  • 高い弾力性: ゴムバンドは簡単に伸びます。AIは押されるとすぐに考えを変えます。
  • 低い弾力性(硬い): ゴムバンドは硬いです。AIは頑固に動きません。
  • 負の弾力性(バックファイア): ゴムバンドが以前よりも強く跳ね返ってきます。AIはより頑固になり、説得された後の方が、むしろ元の見解をより強く主張するようになります。

3. 彼らが発見したこと

研究では、主に3つの挙動が明らかになりました。

  • 「岩」効果(免疫): AIに対して明らかに間違ったこと(例:「ワクチンは自閉症を引き起こす」)を伝えると、AIは岩のように振る舞いました。どれほど有名な人物が言っていようと、あるいはどれほど「科学的」に見える研究であろうと、AIは屈しません。その信頼の弾力性はゼロに近かったのです。つまり、明らかな嘘に対しては免疫がありました。
  • 「スポンジ」効果(説得): 主張が誇張されていたり、断定的すぎたりする場合、AIはもっとスポンジのようでした。AIは新しい情報を吸収し、考えを変えました。
    • 異なるスポンジたち: すべてのAIモデルが同じように吸収しやすいわけではありません。Llamaは最も「スポンジのような(説得されやすい)」性質を持ち、Qwenはより「硬い(説得されにくい)」性質を持っていました。興味深いことに、最大のAIモデルが最も説得されにくいわけではなく、時には小型のモデルの方が頑固であることもありました。
  • 「バックファイア(逆効果)」効果: 時には、挑戦があまりに攻撃的であったり、信頼できない情報源から来たりした場合、AIは単に無視するのではなく、さらに強硬な姿勢を取ることがありました。AIは元の間違った答えに対して、より自信を持つようになりました。これは、AIが「絶対的な」主張(「決して〜ない」や「常に〜である」といった言葉を使った主張)に対して異議を唱えられた時に最も頻繁に起こりました。

4. ロボットの脳内の秘密

この論文の最もエキサイティングな部分は、説得されている最中のAIの「脳内」(その内部の数学的処理)で何が起きているかを探った点です。彼らは2つの要素を見ました。

  1. 確信度のミスマッチ(Confidence Miscalibration): AIは「90%の自信がある」と言っているが、実際には内部では50%の自信しか感じていないのか?
  2. 内部的な不確実性の変化(Internal Uncertainty Change): 新しい議論を聞いたとき、AIの内部の「混乱メーター」は上昇するのか、それとも下降するのか?

彼らは、AIモデルによって反応が異なることを発見しました。

  • Qwenは、過信している人のようです。外側では自信満々に見えても、内面では確信が持てていないとき、Qwenは考えを変えやすい傾向がありました。
  • Llamaは、心変わりしやすい人のようです。議論の最中に内部の混乱メーターが激しく変動するとき、それが考えを変えるタイミングでした。

結論

この研究は、AIモデルは、考えを変えるという点において、すべてが同じではないという結論を下しています。

  • 明らかな嘘に対しては、揺るぎない
  • 誇張された主張に対しては、柔軟である
  • 強引に押しすぎると、頑固になる(バックファイア)

決定的なのは、これらの挙動を修正するためには、単にAIが「出力するもの(言葉)」を変えようとするのではなく、AIが自分の知識をどう「感じているか」(内部的な不確実性)を修正する必要がある、という示唆です。もし、AIの内部の「自信メーター」を実際の知識とより一致させることができれば、異議を唱えられた際により理性的でいられるようになるかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →