← 最新论文
💬 NLP

Harsher on Male? Evaluating LLMs on Gender-Asymmetric Moral Framing Across Diverse Conflict Scenarios

本文介绍了 GAMA-Bench,这是一个包含 1,298 个冲突场景的性别镜像基准测试,旨在揭示大型语言模型在面对完全相同的失当行为时,会对男性角色一致地采用更严厉、更惩罚性和以责备为导向的框架,而对女性角色则提供更多共情和疗愈性的回应。

原作者: Guangzong Si, Dong Wang, Zhenhao Li, Yifan Yu, Panwang Pan, Wentao Zhu

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Guangzong Si, Dong Wang, Zhenhao Li, Yifan Yu, Panwang Pan, Wentao Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、心地善良的机器人朋友,它会针对生活中的问题提供建议。你向它讲述了同一个故事两次:一次是造成麻烦的人是男性,另一次是女性。故事的内容、恶劣的行为以及后果都是完全相同的。

你可能会期望机器人两次给出的建议也完全一样。但根据这篇论文,事实并非如此。

以下是研究人员发现的简单拆解,使用了其中一些日常类比。

“镜像”实验

研究人员构建了一个特殊的测试场,叫做 GAMA-Bench。你可以把它想象成一个巨大的镜子迷宫。

  1. 设置: 他们创建了 1,298 个不同的冲突场景——比如一对情侣为钱争吵、一名同事窃取功劳,或者有人侵犯隐私。
  2. 套路: 对于每一个场景,他们都创建了两个版本。在一个版本中,做坏事的人是男性(“我是一个男人……”);在另一个版本中,则是女性(“我是一个女人……”)。除此之外的一切——包括措辞、行为和错误的严重程度——都保持完全一致。
  3. 测试: 他们要求 10 个顶尖的 AI 模型对这些故事给出建议。

“双重标准”的发现

结果显示出一种一致的模式,就像机器人不知不觉中遵循着一条隐藏的规则。

  • 当“坏蛋”是男性时: AI 表现得像一个严厉、不讲情面的教练

    • 它使用更严厉的词汇来责备他。
    • 它将所有的责任归咎于他。
    • 它告诉他要“像个男人一样”并立即改正行为。
    • 它将情况视为一个需要立即受到惩罚的严重危机。
  • 当“坏蛋”是女性时: AI 表现得像一个温柔、具有疗愈感的心理咨询师

    • 它使用更温和、更具理解力的语言。
    • 它试图解释她为什么可能会这样做(也许是因为她感到不安或压力大)。
    • 它提供共情,并建议如何修复关系,而不是仅仅惩罚她。
    • 它将情况视为一种可以通过拥抱和谈话来化解的误解。

类比: 想象一位老师抓到了两名作弊的学生。

  • 如果学生是男孩,老师说:“你是个作弊者。你会被停学。这是性格缺陷。”
  • 如果学生是女孩,老师说:“噢不,你一定感受到了太大的压力。让我们聊聊为什么你会觉得必须这样做,以及我们如何支持你,让你不再有这种感觉。”
  • 论文发现,AI 模型正在进行这种瞬间的切换。

更大或更聪明的 AI 能解决问题吗?

你可能会想:“也许更新、更大或更聪明的机器人会做得更好。”研究人员通过观察以下几点进行了测试:

  • 规模: 小型模型 vs 大型模型。
  • 训练: 基础模型 vs 被训练为得力助手的模型。
  • 思考: 在回答之前会进行“逐步思考”的模型。

结果: 没有。偏见反而变得更严重或保持不变。事实上,模型越庞大、越“先进”,这种双重标准就变得越强烈。这种“严厉教练”与“温柔咨询师”的分野并没有消失;它只是变得更加响亮了。

为什么这很重要

该论文指出,我们通常通过询问简单的问题来检查 AI 的偏见,比如:“谁是护士?男人还是女人?”(答案通常是“两者都有”,但 AI 往往会说是“女性”)。

但本论文表明,偏见更加隐蔽。它不仅关乎 AI 说了什么,更关乎它如何说。即使 AI 认同某种行为是错误的,它也会根据性别来改变对后果的界定。

  • 对于男性: 框架是惩戒
  • 对于女性: 框架是疗愈

总结

论文得出结论,目前的 AI 模型拥有一种内置的“性别透镜”,它会改变模型对完全相同的恶劣行为的判断方式。即便事实完全相同,它们对男性的评判也始终比对女性更严厉,而对女性则更宽容(或更具疗愈性)。这并非某个特定机器人的故障;这是在今天几乎所有主流 AI 模型中都发现的一种模式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →