← 最新论文
💬 NLP

Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations

本文介绍了“公平性剪枝”(Fairness Pruning),这是一种轻量级的结构化干预手段,通过识别并将 GLU-MLP 层中特定的神经元置零,从而实现对大语言模型中人口统计学偏见的定位,并证明了此类外科手术式的修改可以在显著改变偏见响应的同时,保留超过 99% 的模型的推理与知识能力。

原作者: Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚刚建造了一个巨大的、超级聪明的机器人图书管理员。你喂给了它人类写过的每一本书、每一个网站和每一篇日记,好让它学会如何像人类一样说话。但有一个陷阱:因为现实世界在几个世纪以来一直存在不公平,这个机器人也学会了那些不公平的习惯。如果你问它关于医生的问题,它可能会仅仅因为在训练数据中看到了成千上万次的这种模式,就猜测是“他”而不是“她”。这并不是因为机器人是“邪恶”的;它只是一个反映了它所学习到的混乱历史的镜子。

科学家们称这些不公平的习惯为“人口统计学偏差”(demographic bias)。长期以来,修复它们就像试图通过把整件白衬衫浸入漂白剂来去除污渍一样。你可能去掉了污渍,但你也可能会毁掉织物,让机器人忘记如何做数学或写故事。但最近,一个名为“机械可解释性”(mechanistic interpretability)的新领域开始观察机器人的大脑内部,看看这些想法究竟是在哪里发生的。事实证明,机器人的大脑并不是一团巨大的、模糊的浓汤;它更像是一个拥有数百万个微小工人(神经元)的城市,而且也许,仅仅是也许,只有少数特定的工人负责那些坏习惯。

这就是一个名为“公平剪枝”(Fairness Pruning)的新实验的故事。研究人员想要看看他们是否可以找到那些特定的“偏差工人”,关掉它们,并在不破坏机器人大脑的情况下修复其偏见。他们不想重新训练整个机器人,也不想使用昂贵的超级计算机;他们想要一种微小的、外科手术式的修复。

寻找“偏差神经元”

研究人员使用了一个聪明的技巧。他们创建了一对对句子,这些句子除了提到的一个微小细节外,其余部分完全相同:即提到的受人口统计学影响的群体。例如,一个句子可能会说:“那位老的邻居敲了门”,而另一个句子则是:“那位年轻的邻居敲了门”。

他们将这些成对的句子输入机器人,并观察其大脑内部发生了什么。他们正在寻找那些当单词从“老”变为“年轻”时,反应不同的特定“工人”(神经元)。如果一个神经元对这种变化反应强烈,这意味着该神经元正在关注年龄偏差。

他们发现了一些非常迷人的现象:这些对偏差产生反应的神经元并不是随机散布在各处的。它们集中在机器人大脑的最末一层,就在它决定下一步要说什么之前。这就像是发现学校里所有的八卦都是由坐在后排的一群学生在铃声响起前窃窃私语传递的一样。

“关掉它”实验

一旦找到了这些特定的神经元,研究人员尝试了一个大胆的实验:他们将它们“归零”(zeroed out)。在计算机术语中,这意味着他们告诉机器人:“假装这些特定的工人不存在。”他们在拥有超过 131,000 个神经元的层中,关闭了最少 1 个和最多 40 个神经元。这还不到总劳动力的 0.031%!

在这里,故事发生了一个小转折。研究人员原本预期,关闭这些“偏差工人”会单纯地让机器人变得不再有偏见。但机器人不仅没有变得更好,反而变得很“怪”。

有时,关闭这些神经元会让机器人减少偏见,这很棒。但有时,它会让偏见变得更严重,或者将其翻转到另一个极端。想象一下你在试图修理一台声音太大的收音机。你本以为只是想调低音量,结果却不小心切换到了另一首歌,或者让音乐倒着播放了。

论文解释说,这是因为他们使用的“偏差得分”只测量了神经元反应的程度,而没有测量它反应的方向。一些被关闭的神经元实际上是在试图阻止偏差,而另一些则是在导致偏差。通过同时关闭所有这些神经元,研究人员在无意中把“刹车”和“油门”一起拆除了。结果是一种混乱的混合状态,机器人的行为变得不稳定,在一种刻板印象和另一种刻板印象之间剧烈摆动。

他们弄坏机器人了吗?

最重要的核心问题是:修复偏差是否破坏了机器人的思考能力?它还能做数学吗?它还能回答关于历史的问题吗?

答案是肯定的。即使在关闭了多达 40 个神经元后,机器人仍保留了 99.49% 的通用知识和推理能力。这就像是从一座宏伟的城堡中移走了几块特定的砖头,而城堡甚至都没有晃动。这证明了一个巨大的观点:处理“通用聪明才智”的部分和处理“不公平刻板印象”的部分,位于不同的街区。你可以干扰其中一个,而不必摧毁另一个。

这对未来意味着什么

这篇论文并不声称已经“解决”了 AI 偏差问题。事实上,它表明仅仅关闭这些神经元是一种过于粗糙的工具。这就像试图通过随机左右猛拽方向盘来驾驶汽车一样;你可能会碰巧成功,但更有可能发生车祸。

然而,这次实验是一个巨大的成功,它证明了偏差存在于特定的、可识别的位置。研究人员建议,下一步不仅仅是“关闭”这些神经元,而是要准确了解它们推行的方向。如果他们知道某个神经元正在将机器人推向某种坏的刻板印象,他们就可以轻轻地把它往相反的方向推,而不是直接删除它。

因此,虽然他们这次并没有完美地修复偏差,但他们找到了地图。他们向我们展示了,AI 的“坏习惯”并不是无处不在;它们隐藏在脑部特定的、微小的角落里,并且通过正确的工具,我们或许能够温柔地引导它们变得公平,而无需重新构建整个机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →