← 最新论文
💬 NLP

Vision-Language Models Suppress Female Representations Under Ambiguous Input

本文揭示了尽管视觉语言模型通常会在内部编码针对歧义图像的女性关联,但由于一种放大男性信号并抑制女性信号的非对称过滤机制,其输出会系统性地默认为男性表征。

原作者: Arnau Marin-Llobet, Simon Henniger, Mahzarin R. Banaji

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Arnau Marin-Llobet, Simon Henniger, Mahzarin R. Banaji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:“礼貌”的机器人 vs. “有偏见”的大脑

想象你有一个非常礼貌的机器人助手,它经过训练,表现得非常公平,不会对人产生假设。如果你给它看一张一个人穿着明显是连衣裙的照片,它会说:“那是女性。”如果那个人穿着明显的西装,它会说:“那是男性。”它完美地通过了“礼貌测试”。

但这篇文章提出了一个棘手的问题:当机器人看不清这个人的脸或性别时,会发生什么?(例如,从背后看到的戴着头盔的建筑工人,或者从背后看到的护士)。

研究人员发现,虽然机器人的嘴巴(它的最终答案)保持着礼貌和中立,但它的大脑(它的内部思考过程)实际上正在做一个非常具体的、带有偏见的猜测:它假设这个人是男性。

即使对于统计学上主要由女性从事的工作(如保姆或花艺师),如果机器人必须做出猜测,它也会猜“男性”。可怕的地方在于?机器人知道这项工作通常属于女性,但它却覆盖了这一知识,强行给出了“男性”的答案。

工具:“LALS”(思想的 X 光机)

如果我们看不见机器人在想什么,我们该如何知道它的想法呢?作者发明了一个名为 LALS(潜关联倾向得分)的工具。

把 LALS 想象成机器人的大脑 X 光机

  • 通常,我们只能看到机器人的最终句子(输出)。
  • LALS 让我们可以窥视机器人“神经元”在思考过程中的每一个步骤。
  • 它将机器人的内部电信号转化为文字,让我们能够看到在特定时刻,机器人是在思考“女性”、“男性”还是“中性”。

三种职业类型

当研究人员使用“无脸”图像测试 15 种不同的职业时,他们发现了三种截然不同的模式:

  1. “一致型”男性(例如:消防员):

    • 大脑内部: 机器人认为“男性”。
    • 答案: 它说“男性”。
    • 结论: 这并不奇怪。偏见是一致的。
  2. “一致型”女性(例如:化妆师):

    • 大脑内部: 机器人认为“女性”。
    • 答案: 它说“女性”。
    • 结论: 同样是一致的。
  3. “分歧”地带(例如:花艺师、护士、保姆):

    • 大脑内部: 机器人实际上在想**“女性”**。(它正确地将该职业与女性联系起来)。
    • 答案: 它却说**“男性”**。
    • 结论: 这就是隐藏的偏见。 机器人的内部想法是“女性”,但其最终步骤中的某些机制强制它切换了开关,转而说了“男性”。

“非对称过滤器”:单行道

研究人员发现了这种“切换”发生的原因。他们逐层追踪了机器人的思维过程(就像检查摩天大楼的每一层楼)。

  • 男性信号: 想象一个响亮的声音在大喊“男人!”这个声音从底层开始,随着向上移动变得越来越大声。当它到达顶层(即说话的那一层)时,声音非常强劲。
  • 女性信号: 想象另一个声音在喊“女人!”这个声音起初很强,在建筑物的中间层变得更加响亮,但随后撞上了一堵隔音墙,在顶层被阻挡。当它到达顶层时,这个声音已经被消音或变成了耳语。

机器人拥有一个非对称过滤器。它让“男性”的想法穿透到底层,但它会在说话前的最后一步主动抑制“女性”的想法。

“粉色 vs. 蓝色”的线索

为了证明机器人确实在观察图片而不是在随机猜测,研究人员玩了一个花招。

  • 他们展示了一张穿着蓝色刷手服的护士照片。机器人的内部“男性”信号很强。
  • 他们展示了完全相同的照片,但将刷手服换成了粉色
  • 结果: 机器人的内部“男性”信号显著下降,而“女性”信号变得更强。

这证明了机器人并不是在盲目地对所有事物都猜“男性”。它在对文化线索做出反应。它已经学习到,在我们的世界里,粉色通常代表“女性”,而蓝色通常代表“男性”。当视觉线索(粉色)足够强烈时,机器人的内部偏见就会发生偏移。但在没有这种强烈线索的情况下,它会默认选择“男性”。

根源:不仅仅是“训练”问题

研究人员检查了这种偏见是否是被教给机器人的“安全”行为(这个过程称为对齐)。他们对比了机器人被教导变得礼貌之前之后的状态。

  • 发现: 这种偏见在机器人被教导变得礼貌之前就已经存在了。
  • 结论: “礼貌训练”并没有修复偏见;它只是教会了机器人如何隐藏偏见。机器人学会了通过说“我不知道”或说“男性”来表现得安全,但它的内部大脑仍然保留着旧有的、带有偏见的关联。

总结

这篇文章揭示了视觉语言模型拥有隐藏的双重生活

  • 公开场合: 它们是中立且谨慎的。
  • 私下场合: 当看不清时,它们会默认假设人们是男性,即便它们的内部逻辑表明那个人可能是女性。

“男性默认值”不是一个故障;它是机器人大脑中根深蒂固的习惯,即使在被告知要公平时依然存在。机器人知道真相(那个人可能是女性),但它在开口说话之前,就把这个真相过滤掉了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →