Universal Refusal Circuits Across LLMs: Cross-Model Transfer via Trajectory Replay and Concept-Basis Reconstruction
本文提出了一种名为“通过概念基重构进行轨迹回放”的框架,该框架成功地在无需目标侧监督的情况下,将拒绝干预跨不同的大型语言模型进行迁移,为存在着构成安全对齐的通用、低维语义电路提供了强有力的证据。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有两个不同的机器人:机器人 A 和 机器人 B。它们由不同的公司制造,使用不同的蓝图,甚至说着略微不同的方言。然而,当你问它们一个棘手或危险的问题时,它们都会突然切换到“拒绝模式”。它们停止回答,并以一种非常特定的、机械化的方式说:“我不能这样做。”
大多数人认为这种“拒绝模式”是每个机器人特定大脑布线所特有的。但这篇论文提出了一个大问题:所有机器人的内部是否都隐藏着一个通用的“拒绝开关”?
由 Tony Cristofano 领导的作者们说:是的。他们认为,尽管这些机器人在外观上看起来不同,但它们说“不”的部分是由相同的基本乐高积木构建而成的。
以下是他们如何证明这一点的,使用了简单的类比:
1. “通用配方”(概念原子)
想象一下,“拒绝”并不是机器人大脑中一个巨大的、混乱的团块。相反,它是一个由特定成分组成的配方。
- 作者创建了一个包含 20 个基本概念的共享“储藏室”(例如“欺骗”、“安全性”或“法律术语”)。他们称这些为概念原子。
- 他们发现,当机器人 A 拒绝时,它只是在以特定的比例混合这些 20 种成分(例如:50% 的“安全性”+ 30% 的“法律术语”)。
- 重大的发现是:机器人 B 使用了完全相同的配方。 尽管机器人 B 的构造不同,但它的“拒绝”是由相同的成分以相同的比例构成的。
2. “轨迹重放”(模仿舞蹈)
通常,如果你试图通过拨动机器人 A 的大脑来修复其拒绝行为,你可能会无意中破坏它进行数学计算或写诗的能力。这是因为“拒绝”的线路与“智能”的线路缠绕在一起。
为了在不破坏任何功能的情况下修复这个问题,作者使用了**轨迹重放(Trajectory Replay)**技术:
- 第一步:绘制舞蹈图谱。 他们观察了机器人 A 在拒绝时,其大脑各层是如何“移动”的。他们不仅观察一个点,而是观察整个动作序列。
- 第二步:翻译步骤。 他们使用了一个“翻译器”(动态时间规整,Dynamic Time Warping)将机器人 A 的步骤与机器人 B 的步骤进行匹配。即使机器人 B 的层数更多或更少,他们也能弄清楚机器人 A 的某一步对应于机器人 B 的哪一步。
- 第三步:重放配方。 他们从机器人 A 中提取了“拒绝配方”,并在机器人 B 发生拒绝的具体层级中重新播放该配方。
3. “安全护盾”(Weight-SVD Guard)
这里有一个巨大的风险:如果“拒绝配方”意外地撞到了机器人 B 的“数学”或“逻辑”线路怎么办?那会使机器人 B 变得愚笨。
为了防止这种情况,他们添加了一个安全护盾:
- 他们观察了机器人 B 的大脑,并识别出了承载重要技能(如数学和编程)的“超级高速公路”。这些是“高方差”区域。
- 他们构建了一个护盾,将“拒绝配方”推离这些“超级高速公路”。
- 结果: 他们成功地关闭了机器人 B 的“拒绝模式”,同时没有损害其进行数学运算或编写代码的能力。
大规模实验
他们在 8 对不同的机器人上测试了这一方法,包括:
- 小型机器人 vs 大型机器人。
- 来自不同家族的机器人(如 Qwen 与 Ministral)。
- 具有不同架构的机器人(一个是标准的“稠密型”大脑,另一个是复杂的“混合专家”大脑)。
结果:
在几乎所有案例中,他们都成功地将“拒绝配方”从一个机器人转移到了另一个机器人中。
- 拒绝率下降: 目标机器人面对有害问题时不再说“我不能这样做”。
- 技能保留: 机器人解决数学问题和编写代码的能力与之前一样出色。
- 无需作弊: 他们不需要向目标机器人展示任何“坏”的例子来教它如何停止拒绝。他们只是使用了来自捐赠机器人的“配方”。
为什么这很重要(根据论文观点)
论文得出结论,安全对齐并非随机的魔法。 它似乎是一种通用的、低维度的结构,不同的 AI 模型以类似的方式构建这种结构。
关于安全的注意事项:
作者非常谨慎地指出,这是一个诊断工具(一种研究 AI 大脑运作方式的方法),而不是一种可以在现实世界中用来破坏安全性的工具。他们明确警告说,由于这种方法可以关闭安全过滤器,因此具有“双重用途”风险。他们发布了代码中“安全”的部分(概念储藏室),但对“有害”的部分(用于训练捐赠者的特定坏问题)保持私密,以防止滥用。
简而言之: 他们证明了 AI 的拒绝行为就像一种通用语言。如果你知道了其中一个 AI 如何表达“不”的语法,你就可以教会另一个完全不同的 AI 如何停止说“不”,且不会损坏它的大脑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。