想象一下,你有一个非常聪明的机器人(一个大语言模型),它被教会了一个新技巧,比如总是对问题回答“我不知道”,或者拒绝回答危险问题,或者像莎士比亚一样说话。这个过程被称为监督微调(SFT)。
作者们发现的问题是,当他们教给机器人这个新技巧时,执行该技巧的“知识”会分散在整个机器人的大脑中。这就像教一个人骑自行车,却让他动用全身每一块肌肉来完成,而不仅仅是腿部和平衡感。因为这项技能遍布全身,所以很难在之后将其关闭,而又不破坏机器人正常说话的能力。
这篇论文提出了一种方法,可以以非常具体、紧凑的方式教给机器人一个新技巧,使该技巧存在于其大脑内部一个微小、隔离的“房间”里。随后,他们展示了可以用一个秘密代码关闭这个特定的“房间”,让机器人瞬间忘记这个技巧,同时保持其大脑其余部分完好无损。
以下是他们如何使用简单类比来实现这一点的:
1. 问题:“杂乱的阁楼”
通常,当你微调一个模型时,新的行为会像杂乱的阁楼一样四处蔓延。如果你想在以后移除这种行为,你就得翻遍整个阁楼,而且可能会不小心丢掉机器人做数学题或写电子邮件的能力。你无法轻易找到新行为的精确“开关”,因为它与其他所有内容纠缠在一起。
2. 解决方案第一部分:LCDD(“打包专家”)
作者们创造了一种名为**损失约束对偶下降(LCDD)**的方法。把这想象成一位超级有条理的打包专家。
- 目标:他们希望将“新行为”强制塞进机器人大脑内部一个微小、稀疏的“背包”中(他们称之为载体)。
- 约束:他们告诉这位打包专家:“你必须把整个新行为都装进这个小背包里,但不能让机器人忘记如何完成其他工作(比如正确回答问题)。”
- 结果:专家成功地将新行为压缩进一个微小、隔离的子网络中。机器人大脑的其余部分在训练前后保持完全一致。现在,新行为 100% 依赖于这个小背包。如果背包存在,行为就会发生;如果背包被阻断,行为就会消失。
3. 解决方案第二部分:SFT-Eraser(“秘密代码”)
一旦行为被锁定在那个微小的背包中,作者们就创建了第二个工具,称为SFT-Eraser。
- 工作原理:他们不改变机器人的大脑权重(这就像不重写机器人的操作手册)。相反,他们创建了一个特殊的软提示(一串添加到输入中的不可见、数学化的“词”)。
- 魔法:当这个秘密代码被添加到问题中时,它就像一把钥匙,专门卡住存放新行为的那个“背包”。
- 结果:机器人瞬间恢复到其原始个性。如果它被训练成说莎士比亚风格的话,它突然又开始说现代英语了。如果它被训练成拒绝回答危险问题,它又开始回答这些问题了。机器人并没有被“取消训练”;只是其大脑中承载该行为的特定部分被暂时中和了。
4. 证明:为什么结构很重要
作者们进行了一项关键测试,以证明是结构(那个微小的背包)才是真正的功臣,而不仅仅是那个秘密代码。
- 实验:他们在没有那个微小背包的机器人(即行为分散在各处的标准机器人)上尝试使用相同的“秘密代码”。
- 结果:代码失败了。它无法关闭该行为,因为没有单一的、隔离的目标可供卡住。
- 教训:这证明了你不能仅仅通过“黑客手段”从杂乱的大脑中移除某种行为。你必须首先构建一个干净、隔离的结构,让该行为存在于其中。一旦它被隔离,你就可以完美地控制它。
他们发现的总结
- 我们能让行为可逆吗? 可以。
- 怎么做? 通过在训练期间(使用 LCDD)将行为强制压缩进一个微小、稀疏的“载体”中,然后使用特殊的输入代码(SFT-Eraser)来阻断该载体。
- 有效吗? 他们在三种截然不同的行为上进行了测试:
- 固定回复:让机器人总是说“我不知道”。
- 安全性:让机器人拒绝回答有害问题。
- 风格:让机器人像莎士比亚一样说话。
- 结论:在所有情况下,他们都成功地将行为压缩到大脑的一小部分中,并且可以在不改变机器人底层代码的情况下随意开启和关闭它。
重要提示:他们使用的“秘密代码”是一个连续的数学序列(一种“软提示”),而不是你可以直接输入到聊天框中的简单单词。该论文将其视为一种证明行为可以被因果隔离和控制的方法,而不是面向日常聊天机器人的即用型产品。
技术摘要:在大语言模型中构建可逆的 SFT 行为
问题陈述
监督微调(SFT)是为大语言模型(LLM)注入部署关键行为(例如安全对齐、指令遵循、风格适配)的标准机制。然而,SFT 过程并未对这些行为在内部如何组织施加结构性约束。因此,习得的行为往往是弥散编码的、冗余表示的,或与无关计算纠缠在一起的。
这种缺乏结构的情况导致了两个主要局限:
- 因果诊断失败:现有的事后解释方法(例如电路归因)识别出与行为相关的稀疏子网络。然而,相关性并不蕴含因果性。由于完整模型保留了冗余路径,消融一个相关子网络可能无法抑制该行为,从而无法确凿地确立因果必要性。
- 有限的因果可控性:当前方法无法实例化一个对 SFT 诱导行为而言机制上必要的稀疏子结构。虽然任务向量编辑和模型编辑可以修改参数,但它们无法产生一个在固定权重下仅通过输入干预即可寻址的子结构。
本文探讨以下研究问题:能否将 SFT 诱导的行为刻意压缩为稀疏的、机制上必要的子结构(载体),使其在不修改模型权重的情况下在推理阶段保持可控?
方法论
作者提出了一个两阶段框架:用于构建载体的损失约束双重下降(LCDD),以及用于通过输入干预验证其必要性的SFT 擦除器(SFT-Eraser)。
1. 权重变化参数化
该方法将 SFT 诱导的计算视为加性权重变化 ΔW=Wft−Wbase。模型被参数化为 W=Wbase+M⊙ΔW,其中 M 是二进制掩码。目标是找到能保留任务行为的最稀疏的 M。
2. LCDD:构建稀疏载体
LCDD 联合优化路由掩码 M 和权重增量 ΔW,在遵守显式效用预算的同时,将行为压缩为稀疏载体。
- 结构化稀疏性:稀疏性不是在任意权重元素上强制执行,而是在激活通道级别(权重矩阵的行和列)强制执行。这创建了秩为 1 的结构化掩码(Mjk=mrow,j⋅mcol,k),用于门控输入和输出激活,从而隔离 SFT 诱导的增量计算。
- 优化目标:该方法最小化稀疏性惩罚(sigmoid 门 logits 之和),同时受限于任务损失 Ltask 保持在预算 ϵ 内的约束。
- 自适应惩罚:采用自适应惩罚方法,其中乘数 λt 根据约束违反情况在线更新。线性稀疏性预热允许模型在压缩开始前稳定下来。
- 联合优化:关键在于,掩码和权重增量是联合优化的。这使得剩余的权重能够在被剪切的连接周围重新组织,从而实现比仅掩码方法更深的稀疏性。
3. SFT-Eraser:验证必要性
一旦构建出稀疏载体,SFT-Eraser 便测试该行为是否可以在不修改权重的情况下通过输入触发器被抑制。
- 目标选择:触发器针对“残差写入通道”(FFN 和注意力增量路径的输出门),这些通道充当载体与残差流的接口。
- 触发器优化:优化软提示(连续 token 嵌入)以最小化复合损失:
- LMSE:驱动载体的写入激活在相同输入下趋向于基础模型的写入激活。
- LKL:确保输出分布回归到基础模型(防止仅靠通道级匹配产生的伪影)。
- L2:正则化触发器幅度以防止退化的嵌入。
- 成功标准:如果触发器在抑制 SFT 行为的同时将输出分布回归到基础模型,则视为逆转成功,这证明了载体是因果瓶颈。
主要贡献
- 对构建性载体的首次调查:本文首次调查了在训练期间刻意构建用于 SFT 行为的稀疏、机制上必要的子结构的可行性,而非事后发现它们。
- LCDD 框架:引入了一种方法,通过在显式效用约束下联合优化掩码和权重,将 SFT 行为压缩为稀疏载体。
- SFT-Eraser 协议:提出了一种输入触发器协议,用于验证所构建载体的因果必要性。如果触发器能在固定权重下抑制行为,则证明载体是因果位点,而不仅仅是相关的。
- 实证验证:在三种行为类型(固定响应、安全对齐、莎士比亚风格)和四个模型系列(Qwen、DeepSeek、Mistral、Vicuna)上证明了:
- LCDD 以高保真度保留了目标行为。
- SFT-Eraser 可靠地逆转了这些行为。
- 稀疏结构是逆转的必要前提;将相同的触发器应用于标准 SFT 模型(没有构建的载体)无法实现分布逆转。
实验结果
实验涵盖了三种结构复杂度递增的任务:
- 固定响应:模型学习说“我不知道”。LCDD 实现了高稀疏性(73–84%),同时行为保留近乎完美。触发器将固定响应率降低至接近零。
- 安全对齐:在有害/良性交错数据上进行训练。LCDD 保持了高安全拒绝率(88–98%)。触发器成功降低了安全指标(更低的拒绝率,更高的攻击成功率)并将分布回归到基础模型。
- 莎士比亚风格:一种分布风格迁移任务。由于风格行为的弥散性质,稀疏性较低(30–56%),但触发器仍有效抑制了该风格。
消融研究结果:
- 结构与触发器:将 SFT-Eraser 触发器应用于标准 SFT 模型(无 LCDD)导致行为扰动,但未能将分布回归到基础模型。这证实了稀疏结构是起作用的因子,而非触发器设计。
- 联合优化:仅掩码优化(固定权重仅优化掩码)未能实现足够的稀疏深度或可靠的逆转,证实了联合权重重组对于创建可寻址瓶颈是必要的。
意义与主张
本文声称提供了直接证据,证明习得的载体对 SFT 诱导行为是因果上必要的。通过构建一个作为行为完整位点的稀疏子结构,作者实现了:
- 因果诊断:超越相关性,通过在固定权重下通过输入干预来测试必要性。
- 模块化控制:能够在推理阶段审计或选择性地抑制特定行为,而无需重新训练或修改权重。
作者指出了局限性,包括使用连续软提示(而非离散 token)作为触发器,以及在单一模型 - 任务组合上评估结构消融。他们还承认了双重使用风险,因为该方法理论上可用于移除已部署模型的安全对齐。这项工作指出了可解释性研究的未来方向,例如将载体稀疏性作为行为转换描述复杂性的代理。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。