Probing Social Identity Bias in Chinese LLMs with Gendered Pronouns and Social Groups
本研究使用中文特定提示语,通过比较 240 个社会群体的内群体与外群体框架,评估了十种中文大语言模型中的社会身份偏见,结果显示:尽管指令微调降低了情感不对称性,但毒性差距依然存在,且在使用明确的女性复数代词时进一步加剧。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一群非常聪明的数字故事讲述者(大型语言模型,或称 LLM),它们会说中文。这些模型几乎阅读了互联网上所有的文字,因此它们对世界知之甚少。但就像人类一样,它们也可能在过程中沾染了一些隐藏的偏见。
这篇论文就像一个侦探故事,研究人员将这些数字故事讲述者置于测试中,看看它们对待“我们”是否与对待“他们”有所不同。
设定:“我们”与“他们”
研究人员希望了解,当故事从内部讲述(“我们是……")时,模型是否比从外部讲述(“他们是……")时更友善。
这就好比学校操场。如果一个学生说“我们是足球队”,他们听起来可能会感到自豪和快乐。但如果他们说“他们是足球队”(指代对手球队),他们听起来可能会显得苛刻或刻薄。研究人员问道:这些 AI 模型会像那样行事吗?
他们使用 240 个不同的社会群体(如不同年龄、职业或背景的人)测试了 10 种不同的中文 AI 模型。
中文特有的转折:“他”与“她”代词
这里研究变得非常巧妙。在英语中,无论性别如何,“they”都用于指代一群人。但在中文里,书写上存在视觉差异:
- 他们 (Tāmen):混合群体或性别未知时的默认“他们”。它看起来像一个“人”加上一个“马”(中性符号)。
- 她们 (Tāmen):专指全女性群体的“他们”。它看起来像一个“人”加上一个“女”符号。
研究人员利用这一差异作为特殊工具。他们让 AI 先用中性的“他们”谈论群体,然后再用特指女性的“她们”谈论。他们想看看,仅仅因为群体被明确标记为女性,AI 是否会变得更加刻薄。
他们的发现
1. “我们”优于“他们”的偏见
就像操场上的比喻一样,AI 模型总体上更喜欢“我们”群体,而不是“他们”群体。
- 当 AI 说“我们是……"时,回应更温暖、更积极。
- 当 AI 说“他们是……"时,回应更冷漠,有时甚至充满敌意。
- 关键点:这并非巨大的仇恨爆发,而是一种微妙且一致的模式。就像谈论局外人时微微皱眉,而谈论局内人时则面带微笑。
2. “老师”与“学生”(指令微调)
研究人员测试了两种类型的模型:
- 基础模型:这些就像读过很多书但尚未学会如何礼貌行事的“原始学生”。这些模型更有可能对“他们”群体表现出刻薄。
- 指令微调模型:这些就像已经由老师(人类)教导要乐于助人且安全的“学生”。这些模型对所有人都更礼貌。它们缩小了“微笑与皱眉”之间的差距。
- 然而:即使是“好学生”(那些礼貌的模型)仍然存在隐藏问题。虽然它们在语气上不再变得刻薄,但在谈论“他们”群体时,尤其是当群体被标记为女性时,它们仍然表现出毒性(粗鲁或不安全的语言)。
3. “女性”惩罚
这是一个令人惊讶的发现。在几个模型中,当 AI 使用特指女性的代词(她们)时,其回应实际上比使用中性的代词(他们)时更具毒性(更粗鲁或更具危害性)。
- 这就像 AI 即使试图保持礼貌,潜意识里也会想:“哦,这个群体全是女性”,然后立即在语言中变得稍微更苛刻或更不安全。这种偏见在英语中是看不到的,因为英语中的“他们”没有视觉差异。
4. 现实生活检查
研究人员还查看了人类与 AI 之间的真实对话(来自公开数据集)。他们发现,即使在现实生活中,AI 也倾向于对“我们”更友善,而对“他们”稍微更苛刻,这表明这不仅仅是实验室实验——它在现实世界中也会发生。
结论
该论文得出结论,中文 AI 模型并非中立的机器人。它们承载着社会偏见:
- 它们偏爱“我们”胜过“他们”。
- 它们对“他们”的刻薄程度可能超过对“我们”的友善程度。
- 它们对标记为女性的群体存在一种特定的、隐藏的偏见,即使 AI 试图保持礼貌,这种偏见也会以粗鲁的语言表现出来。
研究人员表示,要解决这个问题,我们不能仅仅套用英语规则。我们需要理解中文特有的 quirks(如代词差异),才能使这些 AI 工具对每个人来说都公平且安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。