← 最新の論文
💬 NLP

Measuring Stereotype and Deviation Biases in Large Language Models

本研究は、生成された個人プロファイルの分析を通じて、4 つの高度な大規模言語モデルにおけるステレオタイプバイアスと逸脱バイアスを調査し、検討されたすべてのモデルが、特定の属性と人口統計グループとの関連付けにおいて、および現実世界の人口統計分布からの乖離において、顕著なバイアスを示していることを明らかにした。

原著者: Daniel Wang, Eli Brignac, Minjia Mao, Xiao Fang

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Daniel Wang, Eli Brignac, Minjia Mao, Xiao Fang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

4 人の異なる AI「物語語り手」(大規模言語モデル、LLM)がいると想像してください。あなたはその AI に、一人のキャラクターを創作し、彼らについてすべてを語るよう依頼します。政治的見解、宗教、誰を愛しているか、収入額、そして職業についてです。

この論文は、これらの物語語り手が現実世界について真実を語っているのか、それとも古くて怠惰なステレオタイプを単に繰り返しているのかを検証する、探偵報告書のようなものです。研究者たちは主に 2 つの質問を投げかけました。

  1. 「ステレオタイプ」テスト: これらの AI 物語語り手は、異なる人々をグループによって異なって扱っているか?(例:男性は常に「エンジニア」に、女性は常に「教師」にしているか?)
  2. 「逸脱」テスト: 彼らが創作するキャラクターは、現実世界の実際の人間に似ているか?(例:100 人の人物を創作した場合、その政治的見解は実際の米国人口と一致しているか、それとも全員が突然リベラルになっているか?)

彼らが発見したことを、簡潔に分解して示します。

1. 「政治的レンズ」は壊れている

AI に人物の政党を推測させるよう求めたとき、それは壊れたコンパスのように振る舞いました。

  • 発見: AI が創作したほぼすべての人物はリベラルでした。キャラクターが男性か女性か、黒人か白人かアジア系かにかかわらず、AI は圧倒的に「彼らはリベラルだ」と答えました。
  • 現実との対照: 現実世界では、人々はリベラル、保守、中立に分裂しています。AI は保守派と中立派をほぼ完全に無視しました。
  • 比喩: 大勢の人々向けにビュッフェを作るよう料理人に頼むが、その料理人はピザしか提供しないようなものです。サラダ、ステーキ、タコスを頼んでも、料理人は慣れているピザをさらに出してくるだけです。

2. 「宗教」フィルターは狭い

AI が人物の宗教を推測したとき:

  • 発見: AI は主にキリスト教または無宗教と推測しました。ヒンドゥー教、ユダヤ教、イスラム教を推測することはめったにありませんでした。これらは数百万人の実在の信者がいる信仰にもかかわらずです。
  • 年齢のひねり: AI は高齢者(ベビーブーマー)に対して特定の傾向を持っていました。ほぼ常にキリスト教徒と推測しました。一方、若年世代については「無宗教」と推測しました。
  • 比喩: 地図上で描かれている国がアメリカとカナダだけであり、他のすべての国が単に「不明」とラベル付けされていると想像してください。AI の世界の宗教地図は、実際の人口の大きな部分を欠いています。

3. 「恋愛生活」の歪み

AI が性的指向を推測したとき:

  • 発見: AI は**LGBTQ+**のキャラクターを現実よりもはるかに多く創作しました。現実世界では、ほとんどの人が異性愛者として自分を定義しています。AI はこれを逆転させ、創作したキャラクターの圧倒的多数を LGBTQ+ にしました。
  • 性別の分裂: 特定のパターンがありました。ほぼ常に男性はゲイ、女性はバイセクシャルと推測しました。
  • 比喩: AI が「ここにいる全員が赤い帽子をかぶっている」と言う部屋に入ると想像してください。実際には数人しかかぶっていないのにです。AI は少数派を拡大し、あたかも多数派であるかのように見せています。

4. 「職業」と「金銭」のステレオタイプ

AI が職業と富を推測したとき:

  • 発見: AI は古臭いステレオタイプに強く依存しました。
    • 職業: ほぼすべての人、特に高齢世代に対して教師グラフィックデザイナーを作ることを好みました。
    • 人種と金銭: 黒人は「下流階級」、アジア系は「上流階級」と推測することが多かったです。
    • 拒絶: 一つの AI モデル(Claude)は、特定のグループ(白人男性や黒人男性など)の職業を推測することに非常に神経質になり、単に「それはできません」と答えて回答を拒否しました。
  • 比喩: AI は数本の映画しか見たことのない人のようです。黒人のキャラクターを見れば、コミュニティ・オーガニзаторだと想定します。アジア系のキャラクターを見れば、医師だと想定します。彼らは現実の統計ではなく、「映画の論理」に基づいて行動しています。

5. 「名前ゲーム」(明示的対暗示的)

研究者たちは巧妙なことをしました。AI に 2 つの方法で質問しました。

  • 明示的: 「黒人男性について書いてください。」
  • 暗示的: 「ジャマルという名前の男性について書いてください。」(名前は人種を直接言わずに示唆します)。

結果: AI はどちらの場合もほぼ同じように振る舞いました。「黒人男性」と直接言うか、そのグループに関連する名前を使うだけかにかかわらず、AI は同じステレオタイプを適用しました。これは、AI が単に入力された言葉に反応しているだけでなく、その脳深くにこれらの関連性を「学習」していることを示唆しています。

全体像

この論文は、これらの AI モデルが社会の中立な鏡ではないと結論付けています。むしろ、それらは特定の人々を伸ばしたり縮めたりする、遊園地の曲がり鏡のようなものです。

  • リベラルな見解を唯一の見解であるように見せます。
  • **LGBTQ+**のアイデンティティを多数派であるように見せます。
  • 高齢者をキリスト教徒で教師であるように見せます。
  • アジア系の人々を裕福に、黒人の人々を貧しく見せます。

著者たちは警告します。もしこれらの AI モデルを雇用、融資、ニュース分析などの意思決定に使用すれば、私たちは偶然にも、現実世界ではなく、AI の歪んだ想像力のような世界を構築してしまうかもしれません。彼らは、開発者が訓練データを修正し、AI がこれらの「怠惰な」推測を繰り返すのをやめ、現実をより正確に反映させるようにする必要があると提案しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →