reward-lens: A Mechanistic Interpretability Library for Reward Models
本文介绍了“奖励透镜”(reward-lens),这是一个开源库,它通过利用奖励头权重向量作为核心轴线,将机械可解释性工具适配于奖励模型,揭示了线性归因方法无法预测因果修补效应,从而促使人们构建一个将这种差异视为基本特性而非缺陷的框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你构建了一个非常聪明的机器人,它通过倾听人类反馈来学习如何变得乐于助人。为了训练这个机器人,你不仅仅告诉它“做得好”或“做得差”。相反,你使用一个奖励模型(Reward Model)。把这个奖励模型想象成一位严厉、无形的法官,它根据每个回答在多大程度上符合人类偏好,给出一个单一的数字(分数)。如果机器人获得高分,它就会继续做同样的事;如果获得低分,它就会尝试其他方法。
问题是:我们并不真正了解这位法官是如何思考的。
多年来,科学家们拥有一套工具包,可以窥探生成式人工智能模型(那些写故事或写代码的模型)的大脑。他们可以看到哪些神经元在点亮,以决定下一个词是什么。但这套工具包是为输出词列表的模型构建的。然而,奖励模型并不输出词语;它输出一个单一数字。这就像试图用为绘画设计的显微镜来检查一滴墨水。工具并不适用。
解决方案:“奖励透镜(Reward-Lens)”
这篇论文介绍了reward-lens,这是一个专门设计用于观察这些“单一数字”法官内部的新库(一套软件工具)。
以下是核心思想,通过一个类比来解释:
想象人工智能的大脑是一条拥有 32 个房间(层)的长廊。在每个房间里,信息被处理并传递给下一个房间。在长廊的尽头,有一张法官的桌子(奖励头)。法官查看最终信息并写下分数。
作者们意识到,法官的桌子有一个特定的“方向”是它关心的。就像法官有一个特定的向量(箭头),指向“好”的方向。
- 旧方法:科学家们试图通过问“下一个词会是什么?”来观察这条长廊(这对分数来说没有意义)。
- 新方法(Reward-Lens):该库问的是:“这个特定房间中的信息在多大程度上推高了或降低了最终分数?”
它通过将长廊的每一步投射到法官的“好箭头”上来实现这一点。这使得科学家能够确切地看到大脑中“ goodness(好)”是在哪里被计算出来的。
该库的功能(工具包)
论文描述了该库中的几种工具,每种工具都有简单的目的:
奖励透镜(X 光片):
- 类比:想象逐帧观看电影,以观察英雄何时决定与反派战斗。
- 功能:它确切地显示了在人工智能的处理过程中(哪一层),决定给出高分或低分的时刻。作者发现,对于某些模型,这个决定发生得很晚(在最后几层),而对于其他模型,它发生得更早且更混乱。
组件归因(记分卡):
- 类比:分解期末考试成绩,看看多少分来自论文、数学和选择题。
- 功能:它计算人工智能大脑的每个特定部分对最终分数的贡献程度。
- 大惊喜:作者发现了一个巨大的脱节。那些看起来在做最多工作的大脑部分(基于记分卡),并不是实际上获得正确答案所必需的部分。如果你关闭“顶部”部分,分数几乎没有变化。如果你关闭“底部”部分,分数就会崩溃。这意味着仅看记分卡是具有误导性的。
激活修补(交换测试):
- 类比:从一个“好”答案中取出一个脑细胞,并将其交换到一个“坏”答案中,看看它是否能修复坏答案。
- 功能:这是一种“因果关系”测试。它在首选答案和非首选答案之间物理交换人工智能处理的部分,以观察什么实际上改变了分数。这是唯一能确切知道什么重要的方法。
黑客检测器(测谎仪):
- 类比:测试法官是否容易被奉承、长单词或花哨的格式所欺骗。
- 功能:它检查人工智能是否奖励“阿谀奉承”(即使错了也同意用户)或“长度偏见”(认为更长的答案更好)。
- 发现:两个不同的模型表现截然不同。一个模型讨厌奉承和长答案;另一个模型实际上奖励它们。
概念分析(思想检测器):
- 类比:检查人工智能的大脑中是否内置了关于“礼貌”或“自信”的特定“思想”。
- 功能:它查找人工智能是否拥有像“同意”或“冗长”这样的概念的线性“向量”,并检查法官是否奖励这些概念。
主要结论
这篇论文中最重要的发现是一个坏消息,但它是诚实的坏消息:你不能信任“记分卡”(归因)来告诉你什么才是真正重要的。
在生成式人工智能(写故事)的世界里,记分卡和因果关系测试通常是一致的。但对于奖励模型,它们不一致。那些看起来在承担繁重工作的大脑部分,往往只是“冗余的”(即使移除它们也不会改变分数),而那些看起来安静的部分实际上是关键的“承重”支柱。
为什么这很重要
作者构建这个库是为了阻止科学家做出错误的假设。在此之前,人们可能会查看一个奖励模型,看到大脑的某个特定部分在点亮,然后说:“啊哈!这就是安全逻辑所在的地方!”并试图修复它。这篇论文说:“等等,那可能是一个红鲱鱼(误导线索)。你需要做‘交换测试’(修补)来确认。”
现在,任何人都可以使用该库来:
- 观察偏好是在人工智能大脑的何处形成的。
- 查明人工智能是否被奉承或格式所欺骗。
- 理解为什么不同的人工智能模型会做出不同的安全决策。
简而言之,reward-lens是第一副眼镜,让我们能够清晰地看到人工智能内部那位“法官”实际上是如何思考的,揭示出大脑比我们之前想象的更加复杂和具有欺骗性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。