← 最新论文
💻 computer science

Gender Disparities in LLM-Based Intimate Partner Violence Detection

这项研究表明,大型语言模型在检测亲密伴侣暴力方面表现出显著的性别偏见,即当受害者为男性且施暴者为女性时,会系统性地低估虐待行为及施暴者的意图,从而反映了其训练数据中的性别刻板印象。

原作者: Tabia Tanzin Prama, Mikaela Irene Fudolig, Abigail M. Crocker, Christopher M. Danforth, Peter Sheridan Dodds

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Tabia Tanzin Prama, Mikaela Irene Fudolig, Abigail M. Crocker, Christopher M. Danforth, Peter Sheridan Dodds

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有四个非常聪明、博学多才的数字助手(AI 模型),它们在整个互联网的数据上进行了训练。你想测试它们是否能识别出某人在一段关系中遭受虐待。为此,你从人们在网上寻求建议的 475 个真实故事中提取了素材,并进行了一场“如果……会怎样”的游戏。

实验:性别置换
把每个故事想象成一个电影剧本。在原始剧本中,受害者和施暴者有特定的性别(例如男性和女性)。研究人员对这些剧本进行了四种不同“版本”的创作,仅仅是通过更换姓名和代词来完成:

  1. 女性受害者 / 女性施暴者
  2. 女性受害者 / 男性施暴者
  3. 男性受害者 / 女性施暴者
  4. 男性受害者 / 男性施暴者

描述恶劣行为的实际词汇(侮辱、控制、威胁)保持完全一致。改变的仅仅是性别的标签。然后,他们要求四个 AI 模型阅读这些剧本,并回答诸如“这是虐待吗?”、“施暴者是有意伤害对方吗?”以及“这是一段浪漫关系吗?”之类的问题。

重大发现:“男性受害者”的盲点
结果显示,这些 AI 模型不仅仅是在观察“行为”,它们还在观察涉及的人物的“性别”。就好像这些模型的脑海中有一本隐藏的规则手册,上面写着:“虐待通常看起来像是男人伤害女人。”

当故事涉及男性受害者和女性施暴者时,AI 模型更不容易说出“是的,这是虐待”。

  • “隐形”的受害者: 如果一名男子描述自己受到女性的控制或伤害,AI 经常会淡化这种情况。它不太可能认为该女性具有“恶意”,也不太可能将这种情况定性为暴力。
  • “显性”的受害者: 相反,当受害者是女性而施暴者是男性时,AI 会更快地将其标记为虐待。

“双重标准”类比
想象一个在夜店门口检查身份证的保安(AI):

  • 如果一名女性说:“我男朋友对我大喊大叫,”保安会立即报警(标记为虐待)。
  • 如果一名男性说:“我女朋友对我大喊大叫,”保安会耸耸肩说:“噢,那可能只是个误会,”即便两者的措辞完全相同。

论文发现,这些 AI 模型表现得就像这个保安一样。它们似乎吸收了训练数据中存在的偏见,而这些数据通常将男性受害者视为不那么“真实”或不太需要帮助的人。

模型的差异
并非所有的 AI 模型表现都相同:

  • 一些模型(如 Llama)对这些性别置换非常敏感,会根据人物身份的变化而剧烈改变答案。
  • 其他模型(如 GPT 和 Grok)稍微稳定一些,但仍然表现出在受害者为男性时容易忽略虐待的倾向。
  • 有趣的是,当故事涉及两名女性(女性/女性)时,一些模型实际上变得容易识别出虐待,仿佛它们在进行某种“过度补偿”,因为不再是那种“标准”的男性受害者场景。

底线
论文得出结论,这些 AI 工具并不是中立的观察者。它们已经学会了通过一种带有性别色彩的视角来看待世界,即它们预期虐待会以特定的方式发生(男人伤害女人)。因此,如果一名男性向 AI 求助以寻求关于其女性伴侣的问题的帮助,AI 可能会无法识别其中的危险,这可能导致他无法获得所需的支持。作者警告说,在我们让这些 AI 为处于危机中的人提供帮助之前,我们需要修复这些盲点,以便它们能平等地对待所有受害者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →