Forecasting Side Effects of Activation Steering
本文表明,尽管语言模型中的激活转向经常会对其他行为产生非预期的、结构化的且不对称的副作用,但通过分析模型的未转向表示,这些效应可以在应用前被准确预测,从而实现主动的安全审计和更安全的安全部署。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的、超级聪明的机器人大脑,它能写故事、解数学题,甚至还能提供建议。科学家们发现了一个巧妙的技巧,可以在不需要从头开始重建大脑的情况下,微调机器人的思考方式。与其重新训练整个大脑,不如只需稍微拨动一下机器人思维内部的一个特定的“思考方向”。这就像是调节某个性格特征的音量旋钮:你可以通过在机器人的内部信号中加入一个微小的数学推力,来调高“乐于助人”的程度或调低“啰嗦”的程度。这被称为激活转向(activation steering)。它就像是一个控制机器人性格的遥控器。
但这里有一个陷阱:当你调高一个旋钮时,其他东西可能会发生一些你意想不到的变化。如果你让机器人说话更简洁,它可能会在无意中变得不太礼貌。如果你让它变得更乐于助人,它可能会变得过于渴望对危险的请求说“好”。这些不希望看到的变化被称为副作用(side effects)。对于任何试图使用这项技术的人来说,最大的问题是:我们能在转动旋钮之前预测这些副作用吗? 如果我们无法预测,那么使用这个遥控器就像蒙着眼睛开车——你可能会到达想去的地方,但也可能会撞上别的东西。
这篇论文正是提出了这样一个问题:我们能否在应用激活转向之前,预判其副作用?研究人员表示,是的,我们可以,但并不是以大多数人猜测的那种方式。他们发现,虽然这些副作用很常见且有时很棘手,但它们遵循一种可以被绘制出来的隐藏模式。
性格的隐藏地图
为了理解正在发生的事情,研究人员将机器人的大脑视为一座巨大的城市,其中有 67 个不同的“街区”,每个街区代表一种特定的行为,如“编程”、“拒绝有害请求”、“幽默”或“表现出同理心”。他们想看看当他们“转向”(推动)其中一个街区时,每一个街区会发生什么变化。
他们构建了一个巨大的交叉效应矩阵(Cross-Effect Matrix),这基本上是一张显示当一个街区被推动时,其他街区如何反应的地图。想象一下多米诺骨牌的游戏,但不仅仅是撞倒下一个,而是推动一个街区会在整个城市中引起涟漪。
他们的发现令人惊讶。首先,副作用无处不在。当他们推动一种行为时,大约 33% 到 50% 的其他行为会发生显著变化。这不仅仅是一点小波动;有时变化非常巨大,会将机器人的“性格得分”在四分制量表中移动整整一分。
其次,这些变化是不对称的(asymmetric)。这是最重要的部分。在现实世界中,如果你推开一扇门,它会打开;如果你从另一边推,它会关闭。但在机器人的大脑里,规则更奇怪。如果你推动“彻底性”来让机器人变得更谨慎,它可能会意外地变得更加“不确定”。但如果你推动“不确定性”来让机器人变得更不确定,它实际上可能会变得更不“彻底”。这种关系不是简单的镜像关系;它是一个复杂的、单向的街道。
为什么旧的猜测游戏失败了
在这篇论文之前,人们尝试使用一个简单的规则来猜测副作用:“如果两个转向方向看起来很相似(比如两个向量指向同一个方向),那么它们应该引起相似的变化)。”这就像假设因为两首歌都属于 C 大调,所以它们会带给你同样的感觉。
研究人员测试了这个想法,并发现它惨败了。他们展示了仅仅观察“推动方向”的相似性,只能解释约 23% 实际发生的情况。旧方法无法预测那些奇特的、单向的关系——即推动 A 会帮助 B,但推动 B 会损害 A。这种“相似性”的猜测就像试图通过观察袜子的颜色来预测天气——根本行不通。
新的预言水晶球:传播图
那么,如果旧的方法失败了,他们是如何预测未来的呢?他们构建了一个新的预测工具,叫做传播图(Propagation Map)。
它是这样工作的,用一个简单的类比:想象机器人的大脑是一系列水管。
- 推动(源头): 你在特定的位置(注入层)向管道中注入水。
- 流动(传播): 水在经过机器人的各个层级时,在管道中扭转和转向。
- 传感器(目标): 在管道的末端,有一个传感器可以检测特定行为(如“幽默”)是否存在。
旧的方法只是观察推动的形状,并猜测末端会发生什么。新方法实际上是在模拟管道。他们训练了一个系统,去学习一次推动在管道起始端如何穿过机器人大脑的扭转和弯曲,最终到达末端。
他们利用这张图,在从未实际推动机器人之前就预测了副作用。他们只需观察机器人正常的、未受推动的思想,来学习这些“管道”是如何运作的。然后,他们问道:“如果我们朝这个特定的方向推动,水会流向哪里,又会触及哪些传感器?”
结果:带有局限性的水晶球
结果令人印象深刻。他们的这种新预测方法能够正确预测副作用是会放大(使某种行为增强)还是抑制(使某种行为减弱)大约 68% 到 78% 的主要变化。这比旧的“相似性”猜测要好得多,后者在这些特定预测上几乎表现得和随机猜测差不多。
然而,论文也诚实地说明了它不能做到的事情:
- 它预测方向,而非大小: 该工具擅长告诉你一个行为是会变强还是变弱,但它并不完美,无法准确告诉你它会改变多少。变化的大小主要取决于目标行为本身,而不是推动的方向。
- 它不是魔法: 预测是基于数据中发现的模式。它们并不是完美的“事实真相”,因为它们仍然依赖于一个 AI 评判器来衡量行为。
- 它是特定的: 这适用于他们测试的特定类型的“线性”推动。如果未来有人发明了完全不同的方式来引导机器人,这张地图可能需要重新绘制。
这为什么重要
这篇论文改变了任何试图控制 AI 的人的游戏规则。与其盲目地转动旋钮并寄希望于最好结果,或者等到机器人说出奇怪的话才意识到自己搞砸了,从业者现在可以先看地图。
他们可以询问:“如果我让机器人变得更简洁,它会变得不那么安全吗?”并在触碰代码之前得到一个可靠的答案。它将激活转向从一场碰运气的游戏变成了一项更可预测的工程任务。虽然它没有解决所有问题,但它给了我们一个强大的新工具,让我们在制造水花之前,就能看到机器人思维中那些看不见的涟漪。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。