Analysing Moral Bias in Finetuned LLMs through Mechanistic Interpretability
本文表明,作为一种意图性判断中的道德偏见,Knobe效应会出现在微调后的大型语言模型中,但可以通过针对性的层修补(layer-patching)干预进行定位,且无需重新训练即可予以缓解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何成为一名公正的法官。你不仅仅是给它一本规则手册;你向它展示了成千上万个关于人们做出选择的故事,并问道:“那个人做的是好事还是坏事?”随着时间的推移,机器人学会了其中的模式。但棘手的地方在于:人类并不是完美的法官。我们往往带有隐藏的偏见。例如,如果一个人意外导致了坏结果,我们更有可能说:“他是故意的!”而如果他们意外导致了好的结果,情况则并非如此。这是一个著名的心理学怪癖,被称为“克诺贝效应”(Knobe effect)。这就像我们的脑子里内置了一个过滤器,让我们觉得坏的意外其实是蓄谋已久的,而好的意外仅仅是运气。
科学家们担心,如果我们教机器人像我们一样行动,它们可能会习得这些奇怪的过滤器。如果机器人为我们做出道德决策,我们需要知道:它是在像人类一样思考,还是仅仅是一个巨大的计算器?这就是“机械可解释性”(mechanistic interpretability)发挥作用的地方。把一个巨大的机器人大脑想象成一座拥有数百万个微小工人(神经元)互相传递纸条的巨大城市。机械可解释性就像是戴上 X 光眼镜,去观察究竟是哪些工人在传递哪些纸条。我们不再只是猜测机器人为什么给出某个答案,而是可以窥视机器内部,看到具体的齿轮是如何转动的。这很重要,因为如果我们能找到偏见在机器人内部存在的确切位置,也许我们就能只修理那个特定的齿轮,而不必重建整个城市。
这篇论文的研究人员决定测试这个想法。他们想看看流行的 AI 模型(具体来说是 Llama、Mistral 和 Gemma)是否吸收了“克诺贝效应”,以及如果它们确实吸收了,研究人员是否能找到 AI 大脑中隐藏这种偏见的精确位置。他们首先让 AI 模型针对与人类志愿者相同的道德故事进行测试。他们发现,那些尚未被教导如何像人类一样说话的“原始”AI 模型并没有表现出这种偏见。它们的回答是非常平衡的。然而,一旦研究人员对模型进行了“微调”(finetuning)——即训练它们遵循指令并符合人类的偏好——这种偏见突然出现了。AI 开始变得和我们一样:它更有可能认为坏的结果是蓄意的,而不是好的结果。
但真正的奇迹发生在他们观察机器内部时。利用一种被称为“层补丁”(Layer-Patching)的技术,研究人员将 AI 视为一组堆叠的层,就像摩天大楼的楼层一样。他们怀疑偏见并不是随机分布在各处,而是卡在特定的几层楼里。为了测试这一点,他们从无偏见的原始模型中提取“思想”(激活值),然后将它们逐层替换到有偏见的微调模型中。这就像是用一份干净、无偏见的蓝图,覆盖在一栋受损建筑的特定楼层上,看看整个结构是否能重新变得诚实。
结果出人意料地精确。他们发现,偏见并不是随机散布的;它集中在 AI 大脑的中高层。更令人兴奋的是,他们发现只需将无偏见版本中的一个特定层交换到有偏见的模型中,就足以几乎完全消除克诺贝效应。对于某些模型,偏见从强烈的 1.6 或 3.8 降到了接近于零(0.00 或 0.03)。最棒的部分是?他们做这一切时并没有重新训练模型或改变其权重。这是一种外科手术式的修复。他们还检查了这种“手术”是否破坏了机器人执行其他任务的能力(如回答一般性问题),并发现模型依然保持着原有的智能水平。
该论文表明,这些社会偏见并不是某种神秘、无法修复、从整个系统中涌现出来的魔法。相反,它们是特定的、局部的模式,在我们将 AI 训练得更像人类的过程中,被写入了 AI 的大脑。通过使用这些 X 光眼镜和外科手术式的交换,研究人员展示了我们可以识别并移除这些偏见,通过有针对性的干预,让 AI 在保持乐于助人的同时,不再带有那些不想要的各种人类怪癖。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。