← 最新论文
📊 statistics

Signed-Permutation Coordinate Transport for RMSNorm Transformers

本文指出 RMSNorm Transformer 具有符号置换规范(BdB_d)而非简单的置换规范(SdS_d),并引入了一种符号边际化的匈牙利匹配方法,以实现跨检查点(checkpoint)的鲁棒坐标传输,从而显著提高可解释性工具、转向向量(steering vectors)和优化器状态的可迁移性,并解决现有对齐方法中由对称性引起的失效问题。

原作者: John Sweeney

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: John Sweeney

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有两座完全相同的房子,它们是由同一张蓝图建造的。在其中一座房子里,每个房间都被标记为“厨房”、“卧室”和“浴室”。在另一座房子里,房间的位置完全相同,但有人把标签打乱了。

如果你想把一个特定的家具(比如一个能让房子对糟糕请求说“不”的“转向向量”)从 A 房子移动到 B 房子,你需要知道 B 房子中的哪个标签对应于 A 房子的“厨房”。如果你猜错了,你可能会把“拒绝”按钮放到了“浴室”里,导致房子无法正常工作。

这篇论文是关于解决针对现代 AI 模型的一个非常具体且棘手的这种“标签打乱”问题的。

核心问题:“符号”之谜

长期以来,研究人员认为这些 AI 房子被打乱的唯一方式是通过置换(permutation,即交换)房间。如果房间 1 变成了房间 5,你只需要交换标签即可。

然而,作者发现对于最流行的现代 AI 模型(被称为 RMSNorm 模型,广泛用于 Llama 和 Qwen 等模型),存在第二种隐藏的房间打乱方式:符号翻转(sign flipping)。

请将房间的标签不仅视为一个名字,更视为一个指向某个方向的箭头。

  • 置换(Permutation): 将箭头从指向北改为指向东。
  • 符号翻转(Sign Flip): 保持箭头指向北,但将其翻转为指向

在这些现代模型中,每一个房间都可以独立地翻转其箭头的方向(北 \to 南),而不会破坏房屋的结构。这造成了巨大的混乱。如果你试图仅使用旧有的“交换”规则来移动模型间的工具,你可能会不小心翻转了一半的箭头。

“破碎指南针”类比

该论文指出,目前的 AI 对齐工具就像一个只知道“北”和“东”,却对“南”视而不见的指南针。

  • 旧方法(仅限置换): 你试图通过观察行为来匹配房间。如果模型 1 的房间 A 与模型 2 的房间 B 非常相似,你就将它们匹配。但如果房间 A 的行为实际上是房间 B 的相反(因为发生了符号翻转),旧指南针会认为它们完全不同,并拒绝进行匹配。
  • 结果: 当研究人员尝试使用旧方法移动“转向工具”(例如一个让 AI 拒绝有害请求的按钮)时,这些工具往往会彻底失效。原本的“拒绝”按钮变成了“接受”,或者工具直接停止了工作。

解决方案:“符号边际化”地图

作者引入了一种名为带符号置换传输(Signed-Permutation Transport)的新方法。

想象一下你再次尝试匹配房间,但这一次你拥有一个特殊的放大镜。你不再仅仅询问“房间 A 是否像房间 B?”,而是询问“房间 A 是否像房间 B,或者它是否是房间 B 的完全相反面?”

  1. 观察强度: 首先,你检查连接的强度,忽略它是正还是负。这可以找到正确的房间,即使箭头的方向被翻转了。
  2. 检查符号: 一旦找到了匹配的房间,你就检查箭头的方向。如果箭头被翻转了,在移动你的工具之前,先将其翻转回来。

论文从数学上证明了,如果你忽略符号翻转,你大约会失败 50% 的次数(因为有一半的箭头可能被翻转了)。通过考虑这些翻转,你可以几乎 100% 地恢复正确的对齐。

论文中的现实世界测试

作者不仅做了数学推导,还在真实的 AI 模型上进行了测试:

  • “拒绝”测试: 他们使用了一个让 AI 拒绝回答有害问题的工具。
    • 旧方法: 工具失效了。AI 开始接受有害请求而不是拒绝它们(因为符号被翻转了)。
    • 新方法: 工具完美运行,保留了其 95.8% 的原始效力。
  • “字典”测试: 他们尝试将一个特征字典(SAE)从一个模型移动到另一个模型。
    • 旧方法: 字典变得毫无用处(重构误差巨大)。
    • 新方法: 字典几乎完美地工作。
  • “简历”测试: 他们暂停了 AI 的训练,改变了标签(gauge/标尺),然后尝试恢复训练。
    • 旧方法: AI 忘记了进度,走向了一条完全不同的路径。
    • 新方法: AI 就像什么都没发生过一样,精准地从原处继续训练。

核心结论

该论文得出结论:对于现代 AI 模型,你不能只问“这个神经元是什么?”,除非你首先明确了“标尺”(gauge,即关于如何排列标签和符号的规则书)。

如果你想在这些模型之间移动工具、字典或训练状态,你必须使用新的“带符号置换”规则。如果你不这样做,你就像是在试图驾驶一辆方向盘被旋转了 180 度的汽车:你以为你在直行,但实际上你在倒车。

简而言之: 现代 AI 模型具有隐藏的“符号翻转”对称性。要在这类模型之间移动事物,你必须修复符号,而不仅仅是修改名称。这篇论文提供了实现这一目标的地图和指南针。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →