Conditional Cognitive Biases in LLMs: How Biased User Turns Modulate In-Context Reasoning
本論文は、マルチターン会話における偏ったユーザー入力が最先端のLLMにおける認知バイアスの発現をどのように変調させるかを評価しており、8つのモデルにわたる24,000件以上の検証済みプロンプトからなる包括的なベンチマークに基づき、会話による曝露は一般的にバイアスを増幅させる一方で、明示的なバイアスの手がかりは、公然としたバイアスを抑制するアライメントメカニズムを誘発し得ることを明らかにしている。
原著者: Sachini Weerasekara, Sagar Kamarthi, Jacqueline Isaacs
原著者: Sachini Weerasekara, Sagar Kamarthi, Jacqueline Isaacs
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約:LLMにおける条件付き認知バイアス
問題提起
指示チューニングされた大規模言語モデル(LLM)は、法的推論、医療トリアージ、金融アドバイザリーなどの高リスク領域において、意思決定支援ツールとしてますます導入が進んでいる。先行研究では、ゼロショット評価下でのLLMにおける認知バイアス(フレーミング、アンカリング、確証バイコールなど)の特性化が広く行われてきたが、これらのベンチマークはバイアスをコンテキストに依存しない属性として扱っている。実際の運用環境では、モデルの応答は先行する会話のターンに条件付けられる。バイアスを含むユーザーのターンは、交絡的な因果経路を導入する。すなわち、入力形式をゼロショットから対話へと変化させ(指示チューニングによる条件付けを活性化させる)、同時に、モデルのアライメント学習と相互作用する特定の意味内容を導入するのである。既存の文献では、LLMのバイアス発現の変化が、単なるユーザーターンの存在によるものなのか、それともそのターンに含まれる特定の認知バイアスの内容によるものなのかを、分離できていない。
手法
これらの因果経路を分離するため、著者らは、8つの最先端の指示チューニング済みLLM(GPT-4o、Claude-3.5-Haiku、Llama-3.1のバリアント、DeepSeek-V3を含む)にわたって評価される、新しい3条件実験フレームワークを導入した。
実験設計
各シナリオおよび対象となるバイアスに対し、LLMは以下の3つの異なる条件下で評価される:
- ゼロショット (m∅): 決定プロンプトが事前のコンテキストなしで提示される。
- 中立的なユーザーターン (mn): バイアスのないユーザーターンが決定プロンプトに先行する。これにより、内容を一定に保ちつつ、フォーマットの変化(対話 vs ゼロショット)による影響を分離する。
- バイアスを含むユーザーターン (mb): 特定の認知バイアスを明示的に表現するユーザーターンが決定プロンプトに先行する。
効果の分解
本研究では、バイアス変調のメカニズムを分離するために、3つの推定量を定義する:
- 存在効果 (Δn=∣mn∣−∣m∅∣): 中立的な内容を用いた、ゼロショットからマルチターン対話形式への移行による影響を分離する。
- 内容効果 (δ=∣mb∣−∣mn∣): 対話フォーマットを一定に保ったまま、ユーザーターン内の特定のバイアス内容による影響を分離する。
- 全効果 (Δb=∣mb∣−∣m∅∣=Δn+δ): ゼロショットのベースラインに対する、バイアス発現の純粋な変化量。
データセットと検証
著者らは、9×9のマトリックス(9種類のターゲットLLMバイアス × 9種類の人間によるターン・バイアス)の全81セルにわたる、24,300個の陪審員検証済みユーザープロンプトからなる刺激バンクを構築した。
- バイアスの選択: アンカリング、利用可能性ヒューリスティック、バンドワゴン効果、確証バイアス、フレーミング効果、内集団バイアス、損失回避、計画錯誤、現状維持バイアスの9つのバイアスを、確立されたベンチマーク(Malberg et al., 2025)に基づき選択した。
- 品質管理: 3つのモデルによるLLM-as-judge陪審団(GPT-4o-Mini、Claude-3.5-Haiku、Gemini)が、ターゲットの適合性、純粋性(他のバイアスとの区別)、自然さ、およびブラインド識別精度の4つの基準に従って、すべてのユーザーターンを検証した。
- 因果的特定: 本研究では、集計された相関関係を超えた因果的エビデンスを提供するために、差の差分析(DiD)、傾向スコアマッチング(PSM)、および合成コントロール法(SCM)を採用している。
主な結果
1. バイアスを含むターンは体系的にバイアスを増大させる(全効果)
8つのモデルのうち6つにおいて、バイアスを含むユーザーターンを導入することで、ゼロショットのベースラインと比較してLLMのバイアス発現の大きさが増加した(Δˉb>0、範囲は+0.022から+0.051)。
- GPT-4oは例外であり、2つの基礎的なメカニズムが互いに打ち消し合っている(Δˉb≈0)。
- Claude-3.5-Haikuは、強い負の存在効果によって、負の全効果(Δˉb=−0.064)を示している。
2. 存在効果がバイアスを膨張させる
ユーザーターンの存在自体(たとえ中立的なものであっても)が、8つのモデルのうち7つにおいて、測定されるバイアスを有意に増大させる(Δn の範囲は+0.019から+0.086)。これは、ゼロショットのベンチマークが、会話によるバイアスを系統的に過小評価していることを示唆している。
- 例外: Claude-3.5-Haikuは負の存在効果(Δn=−0.101)を示しており、これは対話モードにおいてバイアスを抑制するConstitutional AIのアライメントと一致している。
- 相関: 高い能力を持つモデル(MMLUで測定)ほど、存在による膨張が小さくなる傾向がある。
3. 内容効果はしばしばバイアスを抑制する
「バイアスを含むコンテキストがバイアスを増幅させる」という仮説に反して、中立的なターンをバイアスを含むターンに置き換えると、8つのモデルのうち6つでバイアスの大きさが減少した(δ<0)。
- この「コントラスト抑制」は、明示的なバイアスの手がかりがアライメントに関連する抵抗を誘発し、より規範的な補完へと導くことを示唆している。
- 例外: DeepSeek-V3およびClaude-3.5-Haikuは正のコンテンツ効果を示している。著者らはこれを、これらが(Chain-of-Thought RLFTやConstitutional AIといった)熟議的なアライメント戦略を採用しており、それらがインコンテキストの信号を抑制するのではなく、増幅させているためであると考えている。
4. 構造と誘導性の結合
9×9 のバイアス結合マトリックスの分析により、以下が明らかになった:
- 行構造の支配: ターゲットとなるバイアスの変調に対する感受性は、特定の人間によるバイアスの種類ではなく、ターゲットとなるバイアス自体によって支配される。
- 対角線の優位性の欠如: 「同一バイアスの伝染」(例:人間がバイアスXを表現すると、モデルにバイアスXが選択的に誘発されること)の証拠は見られなかった。
- 計画錯誤: これは、8つのモデルすべてにおいて普遍的に誘導可能であることが因果的に確認された唯一のターゲットバイアスである。これは、その表現(楽観主義や過小評価)が暗黙的であり、アライメント抑制のキューを誘発しにくいためと考えられる。
- 抑制可能なバイアス: バンドワゴン効果と利用可能性ヒューリスティックは、一貫してインコンテキストのバイアス・ターンによって抑制される。
意義と主張
本論文は、ゼロショットのバイアス・ベンチマークは、対話による「存在効果」を考慮していないため、会話におけるバイアスを系統的に過小評価していると主張している。本研究は以下のことを実証した:
- コンテキストの重要性: 単にマルチターン対話に従事するという行為自体が、モデルのバイアス発現プロファイルを、孤立したプロンプトと比較して変化させる。
- アライメントはレシピ依存的である: コンテンツ効果の方向(抑制か増幅か)は、特定のアライメント・レシピ(標準的なRLHF、Constitutional AI、またはChain-of-Thought RLFTなど)によって決定される。
- 普遍的な誘導性: ほとんどのバイアスは明示的な手がかりによって抑制されるが、計画錯誤は多様なモデルアーキテクチャやトレーニングパイプラインにおいて強固に誘導可能である。
著者らは、安全性評価およびバイアス監査プロトコルは、アライメント・レシピによって層別化し、展開条件を正確に反映するために、先行する会話のターンを含める必要があると結論付けている。彼らは、将来の研究を支援するために、本フレームワーク、コードベース、および24,300項目のデータセットを公開している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。