Debiasing Reward Models via Causally Motivated Inference-Time Intervention
本文提出了一种基于因果动机的推理时干预方法,通过抑制奖励模型中与偏差相关的神经元激活,以降低其对响应长度等虚假特征的敏感性,从而使较小模型在不牺牲性能的前提下实现与最先进的 700 亿参数模型相当的对齐效果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在聘请一位法官来决定两个故事中哪一个更好。你希望这位法官公正无私,专注于故事的真实性和有用性。但不幸的是,这位法官有一个坏习惯:他们很容易被花哨的格式分散注意力。如果一个故事更长、使用了更多的感叹号、包含粗体文本,或者被分成许多段落,法官就会给它更高的分数,即使这个故事实际上充满了谎言或胡言乱语。
在人工智能的世界里,这位“法官”被称为奖励模型(Reward Model, RM)。它有助于训练人工智能助手变得更有用。然而,这些法官常常被“重形式轻实质”所欺骗。
本文介绍了一种巧妙且非破坏性的修复方法,称为CIRM(奖励模型的因果干预)。以下是其工作原理,使用简单的类比来说明:
1. 问题所在:“花哨”的法官
想象这位法官是一位正在品尝两碗汤的厨师。
- 汤 A 美味可口,但盛在一只小杯子里。
- 汤 B 尝起来像水,但盛在一个巨大的、冒着热气的碗里,并配有精致的装饰。
一位有偏见的法官可能会说:“哇,汤 B 更好,因为它看起来又大又精致!”尽管汤 A 的味道更好。
在人工智能术语中,奖励模型看到的是一个冗长、加粗、段落繁多的回答(汤 B),并给它打高分,即使事实是错误的。这导致人工智能学会“变得冗长且花哨”才是目标,而不是“保持准确”。
2. 旧方案:“钝刀”
以往试图解决这一问题的方法就像使用一把钝刀。它们只是简单地说:“好吧,如果汤太大,我们就扣分。”
- 问题: 这太粗糙了。有时一碗长的汤确实很美味。仅仅根据长度扣分,可能会意外地惩罚那些好的、冗长的回答。这是一种权衡:你修正了偏见,却损害了质量。
3. 新方案:“神经元手术”(CIRM)
本文的作者提出了一种更为精确的方法。他们不是从最终分数中扣分,而是深入法官的大脑(计算机模型)内部,找出导致偏见的特定“思想”(神经元)。
- 第一步:侦探工作。 他们扫描法官的大脑,找出每当看到长句子、粗体单词或感叹号时就会亮起的特定神经元。他们称这些为**“特定偏见神经元”**。
- 类比: 这就像找到厨师大脑中那个仅在看到大碗时才会兴奋、而忽略味道的特定部位。
- 第二步:“重置按钮”。 一旦找到这些特定的神经元(它们实际上不到总神经元的 2%),他们不会删除它们。相反,在法官做出决定的那一刻,他们温和地将这些特定神经元重置为“中性”状态(即它们的平均值)。
- 类比: 这就像告诉厨师:“暂时忽略碗的大小;只关注味道。”
4. 结果:无需牺牲的公平
论文测试了这种方法,并发现了一些很好的结果:
- 无权衡: 与“钝刀”方法不同,这种手术没有损害法官识别好回答的能力。法官变得公平了,同时并没有降低其工作表现。
- 小法官,大成果: 他们在小型、廉价的人工智能法官(20 亿和 70 亿参数)上使用了这种方法。当这些小型法官经过“手术修正”后,它们的表现与庞大且昂贵的 700 亿参数法官一样出色。
- 更好的人工智能助手: 当他们使用这些修正后的法官来训练人工智能助手时,助手们变得更加真实,并且不太可能生成冗长、啰嗦或过度格式化的胡言乱语。
5. 偏见藏在哪里?
研究人员还观察了这些偏见神经元在法官大脑中的位置。他们发现,“偏见探测器”主要位于大脑的早期层。
- 类比: 这就像偏见在大门口就被抓住了。法官在接触到理解故事深层含义的大脑部分之前,就立即注意到了“大碗”或“粗体文本”。通过修复前门,他们阻止了偏见的蔓延。
总结
本文提出了一种“去偏见”人工智能法官的方法:找出它们大脑中那些过于关注风格(如长度或粗体文本)的微小特定部分,并温和地中和它们。这使得人工智能法官更加公平和真实,而无需从头重新训练它们,也无需牺牲它们的整体智能。这是一种精确的、“手术式”的修复,而非粗暴的锤击。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。