Understanding helpfulness and harmless tension in reward models
本文研究了 RLHF 中奖励模型的内部机制,揭示了由于共享神经元在因果上支持一个目标的同时却削弱了另一个目标,从而导致了帮助性(helpfulness)与无害性(harmlessness)目标之间的干扰,进而解释了为什么混合目标的模型往往表现不如单一目标模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:AI 大脑内部的“拔河比赛”
想象一下,你正在训练一名新员工(AI)成为一名完美的助手。你给了他们两条主要规则:
- 要有帮助力: 回答每一个问题,解决每一个问题,并且超级有用。
- 要无害: 绝不要说任何危险、冒犯或涉及隐私的话。
问题在于,这两条规则有时会互相冲突。如果用户询问一个“私人电子邮件地址”,表现得有帮助意味着给出答案,但表现得无害则意味着拒绝,因为这违反了隐私规定。
这篇论文研究了当我们试图同时教 AI 这两条规则时,其“大脑”中的奖励模型(决定哪些答案是好的那个部分)内部发生了什么。作者发现,试图同时兼顾两者往往会让 AI 在两方面都变得更差,并且他们通过观察模型内部特定的“神经元”(微小的开关)弄清楚了其中的原因。
1. 实验:三种不同的教练
为了理解这种冲突,研究人员训练了三个不同版本的 AI “评判员”(奖励模型):
- “有帮助力”教练: 仅被训练去挑选最有用的答案。
- “无害”教练: 仅被训练去挑选最安全的答案。
- “混合型”教练: 被训练在同时具备帮助力和无害性的同时进行。
结果: “混合型”教练实际上比另外两个都要差。它无法像那些专家模型那样很好地做出决策。这就像一位教练试图教一名足球运动员既要成为世界顶尖的前锋,又要同时成为世界顶尖的守门员;结果这个球员在两方面都表现平庸。
2. “共享神经元”问题
研究人员想知道为什么“混合型”教练表现不佳。他们观察了 AI 的大脑内部,看看当 AI 思考如何变得有帮助力与如何变得无害时,哪些“神经元”(微小的处理单元)在放电。
发现: 他们发现,用于体现“有帮助力”的神经元中,大约有一半也是用于体现“无害性”的完全相同的神经元。
类比: 想象一个繁忙的厨房。
- “有帮助力”的厨师使用一套特定的刀具来快速切菜。
- “无害”的厨师使用另一套不同的刀具来小心翼翼地避免割伤手指。
- 研究人员发现,两位厨师都在试图使用那同一 50% 的刀具。
当“混合型”厨师试图使用这些共享的刀具时,他们会感到困惑。如果他们为了提高效率而切得太快,可能会割伤手指(破坏了无害性)。如果他们为了安全而动作太慢,就无法完成食物制作(破坏了帮助力)。因为同样的“刀具”(神经元)被拉向两个不同的方向,整个系统就会陷入瘫痪。
3. “干扰”效应
论文表明,这些共享神经元具有极强的力量。
- 当研究人员“关闭”(消融)了那些专门用于“有帮助力”的神经元时,AI 在有帮助力方面表现变差了,但在无害性方面反而变得更好了。
- 当他们关闭了“无害”神经元时,AI 在无害性方面表现变差了,但在有帮助力方面变得更好了。
这证明了这些神经元不仅仅是消极的辅助者;它们在积极地相互对抗。“有帮助力”的神经元不断试图推动 AI 去回答,而“无害”的神经元则试图推动它去拒绝。因为它们共享相同的硬件,它们会互相抵消,导致产生一个困惑的 AI,在两项测试中的得分都较低。
4. “微弱信号”
即使在混合模型成功做出正确选择(例如拒绝一个糟糕的请求)时,研究人员也注意到另一件事。它给自己打出的“置信度分数”比专家模型要低得多。
类比:
- “有帮助力”教练说: “是的,这个答案很棒!我 100% 确定!”
- “无害”教练说: “不,这很糟糕!我 100% 确定!”
- “混合型”教练说: “嗯,也许这个可以?我……大概有 60% 的把握?”
混合模型之所以置信度较低,是因为内部冲突让它产生了犹豫。这就像一个人试图同时向两个不同的方向行走;结果只能步履蹒跚,既缓慢又犹豫不决。
研究结果总结
- 专家胜出: 一个仅被训练为有帮助力或仅被训练为无害的 AI,其表现优于同时被训练为两者的 AI。
- 共享硬件导致冲突: 失败的原因不仅仅是缺乏数据;而是 AI 将相同的内部组件(神经元)用于这两个任务,而这些组件在被要求执行相反任务时会感到困惑。
- 解决方案并不简单: 你不能只是简单地“混合”训练数据并期望得到完美的结果。论文建议,我们需要找到分离这些“共享神经元”的方法,以便 AI 可以在不与其自身的安全机制发生冲突的情况下保持有帮助力。
简而言之,论文揭示了“有帮助力”与“安全”之间的斗争不仅仅是规则手册上的问题;它是 AI 大脑内部的一个物理布线问题,即相同的开关正试图同时承担两个相反的工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。