← 最新论文
💬 NLP

Neuron-Level Interventions for Gendered and Gender-Neutral Generation in Language Models

本文介绍了一种神经元层级的干预方法,该方法通过识别并操控主要集中在语言模型早期层中的性别特定神经元,以实现对女性化、男性化及性别中性生成的精确控制,同时减轻偏见并保留语义含义。

原作者: Zhiwen You, Nafiseh Nikeghbal, Jana Diesner

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiwen You, Nafiseh Nikeghbal, Jana Diesner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个大型语言模型(比如驱动聊天机器人的那些模型)就像一座巨大且繁忙的工厂。在这座工厂内部,有数以百万计的小型工人,被称为神经元。当你要求工厂写一个句子时,这些工人就会亮起灯,互相传递信息,从而构建出最终的输出。

问题在于,即使你要求写一个中性的故事(例如,“医生治疗了病人”),工厂有时也会不小心加入性别偏见,根据旧有的刻板印象将医生变成“他”或“她”。

这篇论文就像是一支侦探团队,他们进入工厂内部,去调查究竟是哪些工人在负责决定一个句子听起来是“男性化”、“女性化”还是“性别中性”的。

以下是他们利用简单类比进行的调查分解:

1. 新地图:不只是两种颜色,而是三种颜色

以往的大多数研究都是通过“二元”视角来看待这座工厂的:这个工人是在制造红色(男性化)还是蓝色(女性化)?它们往往忽略了绿色(性别中性)的工人。

作者意识到,在现实世界中,我们需要所有的三种颜色。他们想要找到处理以下内容的特定工人:

  • 红色:he (他), man (男人), father (父亲) 这样的词。
  • 蓝色:she (她), woman (女人), mother (母亲) 这样的词。
  • 绿色:they (他们/他们), person (人), parent (父母) 这样的词。

2. 侦探工作:寻找“专家”

研究人员开发了一种新方法来识别这些特定的工人。他们不仅仅是在猜测;他们使用了一张“评分卡”,通过观察当模型在谈论特定性别时,哪些神经元反应最强烈,同时又忽略了其他性别。

发现:
他们发现,这些性别专家型的工人并不是随机散布在整个工厂里的。相反,他们聚集在工厂最开始的几个房间里(早期层)。

  • 类比: 想象一场接力赛。关于“谁在跑这场比赛”(性别)的决定,几乎是在起跑线处就做出了,而不是在终点线处。一旦前几个工人决定了“这是一个‘她’的故事”,工厂的其余部分就会紧随其后。

3. 实验: “静音键”测试

为了证明他们找到了正确的工人,研究人员进行了一项“受控实验”。他们拿走一个句子,并要求模型将其改写为另一种性别(例如,将一个关于“男人”的故事改为关于“女人”的故事)。

  • 基准线: 在没有帮助的情况下,模型经常会产生混乱或泄露错误类别的词汇(例如,明明要求写“女性”,却在后面用了“he”)。
  • 干预: 研究人员使用了一个“静音键”(掩码技术)来让除了目标性别之外的所有工人保持沉默。
    • 如果他们想要一个女性化的故事,他们会关掉“男性化”和“中性”的工人,只让“女性化”的工人说话。
    • 结果: 模型在坚持既定性别方面表现得好得多。这就像是关掉了背景噪音,让特定的声音能够被清晰地听到。

4. 结果:精准度与质量

该论文声称其方法优于以往的尝试,因为:

  • 更少泄露: 它阻止了模型意外混合性别(例如,在你要求“they”时却说出“she”)。
  • 意义保留: 故事并没有失去其原始含义;它只是正确地更改了性别标签。
  • 高效: 因为他们发现“性别工人”集中在早期层,所以他们不需要关闭整个工厂,只需要关闭特定的几个房间。

5. 数据集:“训练场”

为了测试这一点,作者构建了两个新的“训练场”(数据集),其中充满了成千上万个句子。

  • 一个数据集是通过将现有的性别化句子改写为中性句子而创建的。
  • 另一个则是利用一份包含性别化和中性术语的词典从头开始构建的,以确保每个句子都被完美地标记为红、蓝或绿。
  • 人类检查了这些句子,以确保它们符合语法规范,并且确实符合预期的性别。

总结

简而言之,这篇论文说:“我们找到了 AI 大脑中控制性别的特定开关。这些开关主要位于思考过程的最开始阶段。通过拨动这些特定的开关并让其他开关保持沉默,我们可以迫使 AI 以特定的性别(男性、女性或中性)进行写作,而不会破坏句子或丢失原始含义。”

作者提供了代码和数据集,以便其他人也可以尝试这种“拨动开关”的技术。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →