← 最新の論文
💬 NLP

Probing Social Identity Bias in Chinese LLMs with Gendered Pronouns and Social Groups

本研究は、240 の社会集団における内集団と外集団の枠組みを比較するためにマンダリン語固有の指示を用いて 10 の中国語大規模言語モデルにおける社会的アイデンティティバイアスを評価し、指示チューニングが感情の非対称性を軽減する一方で、毒性の格差は持続し、明示的な女性複数代名詞の使用によってさらに悪化することを明らかにした。

原著者: Geng Liu, Feng Li, Junjie Mu, Mengxiao Zhu, Francesco Pierri

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Geng Liu, Feng Li, Junjie Mu, Mengxiao Zhu, Francesco Pierri

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いデジタルの物語語り手(大規模言語モデル、または LLM)のグループが中国語を話していると想像してください。これらのモデルはインターネット上に書かれたほぼすべてのものを読み込んでいるため、世界について多くのことを知っています。しかし、人間と同様に、彼らはその過程で何らかの隠れた偏見を身につけてしまったかもしれません。

この論文は、研究者たちがこれらのデジタルの物語語り手をテストにかけ、「私たち」と「彼ら」を異なる扱いをするかどうかを確認する探偵物語のようです。

設定:「私たち」対「彼ら」

研究者たちは、物語が内側から語られる場合(「私たちは…」)と、外側から語られる場合(「彼らは…」)で、モデルが特定のグループに対してより親切になるかどうかを確認したいと考えていました。

学校のアスレチックを想像してください。もし生徒が「私たちはサッカーチームだ」と言えば、誇らしくて幸せに聞こえるかもしれません。しかし、「彼らはサッカーチームだ」と言えば(ライバルチームを指して)、批判的または意地悪に聞こえるかもしれません。研究者たちは問いかけました:これらの AI モデルもそう振る舞うのでしょうか?

彼らは、240 の異なる社会的グループ(異なる年齢、職業、背景を持つ人々など)を用いて、10 種類の異なる中国語 AI モデルをテストしました。

中国語特有のひねり:「彼」と「彼女」の代名詞

ここで研究は非常に巧妙になります。英語では、性別に関係なく人々のグループに対して「they(彼ら)」という単語が使われます。しかし、中国語では、書き言葉に視覚的な違いがあります。

  • 他们 (Tāmen): 混合グループや性別が不明な場合のデフォルトの「彼ら」。これは「人」に「馬」がついた形(中立的な象徴)のように見えます。
  • 她们 (Tāmen): 女性だけのグループに対する特定の「彼ら」。これは「人」に「女」がついた形のように見えます。

研究者たちは、この違いを特別な道具として利用しました。AI に中性の「彼ら」を使ってグループについて話させ、次に女性専用の「彼ら」を使って話させるよう求めました。グループが明示的に女性としてマークされただけで、AI が意地悪になるかどうかを確認したかったのです。

彼らが発見したもの

1. 「私たち」の方が「彼ら」より優れているというバイアス
アスレチックの比喩と同様に、AI モデルは一般的に「彼ら」グループよりも「私たち」グループを好みました。

  • AI が「私たちは…」と言ったとき、回答はより温かく、より肯定的でした。
  • AI が「彼らは…」と言ったとき、回答はより冷たく、時には敵対的さえでした。
  • 注意点: これは大規模な憎悪の爆発ではなく、微妙で一貫したパターンでした。外部の人々について話すときのわずかなしかめっ面と、内部の人々に対する笑顔のようなものです。

2. 「先生」と「生徒」(指示チューニング)
研究者たちは 2 種類のモデルをテストしました。

  • ベースモデル: これらは多くのことを読みましたが、まだ礼儀正しく振る舞う方法を教えてもらっていない、生粋の生徒のようなものです。これらのモデルは、「彼ら」グループに対して意地悪になる可能性がはるかに高かったです。
  • 指示チューニング済みモデル: これらは、人間(先生)によって親切で安全であるように教えられた生徒のようなものです。これらのモデルは、全員に対してより礼儀正しくなることができました。彼らは「笑顔対しかめっ面」のギャップを減らしました。
  • しかし: 「良い生徒」(礼儀正しいモデル)でさえ、隠れた問題を抱えていました。彼らは口調で意地悪になるのをやめましたが、「彼ら」グループ、特に女性としてマークされたグループについて話すとき、まだ毒性(失礼または安全でない言語)の兆候を示していました。

3. 「女性」へのペナルティ
これは驚くべき発見でした。いくつかのモデルにおいて、AI が女性専用の代名詞(她们)を使用した場合、中性の代名詞(他们)を使用した場合よりも、回答は実際にはより毒性が高い(より失礼で、より有害)ものでした。

  • AI は、礼儀正しくしようとさえしているときでさえ、無意識のうちに「ああ、このグループは全員女性だ」と考え、すぐに言語を少し批判的または安全でないものに変えていたかのようです。これは、英語では「彼ら」の視覚的な違いがないため、英語では見られない偏見です。

4. 実生活でのチェック
研究者たちはまた、人間と AI の間の実際の会話(公開データセットから)も調べました。彼らは、実際の生活でも、AI は「私たち」に対してより親切で、「彼ら」に対してわずかに批判的である傾向があることを発見しました。これは単なる実験室の実験ではなく、現実世界でも起こっていることを示唆しています。

結論

この論文は、中国語の AI モデルは中立的なロボットではないと結論付けています。彼らは社会的偏見を帯びています。

  • 彼らは「彼ら」よりも「私たち」を好みます。
  • 彼らは「私たち」に対して親切である以上に、「彼ら」に対して意地悪になる可能性があります。
  • 彼らは女性としてマークされたグループに対する特定の隠れた偏見を持っており、AI が礼儀正しくしようとさえしているときでさえ、失礼な言語として現れます。

研究者たちは、これを修正するためには、単に英語の規則を使うだけではならないと言っています。これらの AI ツールを全員にとって公平で安全なものにするためには、(これらの代名詞の違いのような)中国語特有の気まぐれを理解する必要があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →