← 最新论文
🤖 machine learning

Crafting Reversible SFT Behaviors in Large Language Models

本文介绍了损失约束对偶下降(LCDD)和 SFT 擦除器,将监督微调行为压缩为稀疏的、因果必要的子网络(“载体”),这些载体可在推理时通过软提示在不修改模型权重的情况下被选择性抑制。

原作者: Yuping Lin, Pengfei He, Yue Xing, Yingqian Cui, Jiayuan Ding, Subhabrata Mukherjee, Hui Liu, Zhen Xiang

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuping Lin, Pengfei He, Yue Xing, Yingqian Cui, Jiayuan Ding, Subhabrata Mukherjee, Hui Liu, Zhen Xiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的机器人(一个大语言模型),它被教会了一个新技巧,比如总是对问题回答“我不知道”,或者拒绝回答危险问题,或者像莎士比亚一样说话。这个过程被称为监督微调(SFT)

作者们发现的问题是,当他们教给机器人这个新技巧时,执行该技巧的“知识”会分散在整个机器人的大脑中。这就像教一个人骑自行车,却让他动用全身每一块肌肉来完成,而不仅仅是腿部和平衡感。因为这项技能遍布全身,所以很难在之后将其关闭,而又不破坏机器人正常说话的能力。

这篇论文提出了一种方法,可以以非常具体、紧凑的方式教给机器人一个新技巧,使该技巧存在于其大脑内部一个微小、隔离的“房间”里。随后,他们展示了可以用一个秘密代码关闭这个特定的“房间”,让机器人瞬间忘记这个技巧,同时保持其大脑其余部分完好无损。

以下是他们如何使用简单类比来实现这一点的:

1. 问题:“杂乱的阁楼”

通常,当你微调一个模型时,新的行为会像杂乱的阁楼一样四处蔓延。如果你想在以后移除这种行为,你就得翻遍整个阁楼,而且可能会不小心丢掉机器人做数学题或写电子邮件的能力。你无法轻易找到新行为的精确“开关”,因为它与其他所有内容纠缠在一起。

2. 解决方案第一部分:LCDD(“打包专家”)

作者们创造了一种名为**损失约束对偶下降(LCDD)**的方法。把这想象成一位超级有条理的打包专家。

  • 目标:他们希望将“新行为”强制塞进机器人大脑内部一个微小、稀疏的“背包”中(他们称之为载体)。
  • 约束:他们告诉这位打包专家:“你必须把整个新行为都装进这个小背包里,但不能让机器人忘记如何完成其他工作(比如正确回答问题)。”
  • 结果:专家成功地将新行为压缩进一个微小、隔离的子网络中。机器人大脑的其余部分在训练前后保持完全一致。现在,新行为 100% 依赖于这个小背包。如果背包存在,行为就会发生;如果背包被阻断,行为就会消失。

3. 解决方案第二部分:SFT-Eraser(“秘密代码”)

一旦行为被锁定在那个微小的背包中,作者们就创建了第二个工具,称为SFT-Eraser

  • 工作原理:他们不改变机器人的大脑权重(这就像不重写机器人的操作手册)。相反,他们创建了一个特殊的软提示(一串添加到输入中的不可见、数学化的“词”)。
  • 魔法:当这个秘密代码被添加到问题中时,它就像一把钥匙,专门卡住存放新行为的那个“背包”。
  • 结果:机器人瞬间恢复到其原始个性。如果它被训练成说莎士比亚风格的话,它突然又开始说现代英语了。如果它被训练成拒绝回答危险问题,它又开始回答这些问题了。机器人并没有被“取消训练”;只是其大脑中承载该行为的特定部分被暂时中和了。

4. 证明:为什么结构很重要

作者们进行了一项关键测试,以证明是结构(那个微小的背包)才是真正的功臣,而不仅仅是那个秘密代码。

  • 实验:他们在没有那个微小背包的机器人(即行为分散在各处的标准机器人)上尝试使用相同的“秘密代码”。
  • 结果:代码失败了。它无法关闭该行为,因为没有单一的、隔离的目标可供卡住。
  • 教训:这证明了你不能仅仅通过“黑客手段”从杂乱的大脑中移除某种行为。你必须首先构建一个干净、隔离的结构,让该行为存在于其中。一旦它被隔离,你就可以完美地控制它。

他们发现的总结

  • 我们能让行为可逆吗? 可以。
  • 怎么做? 通过在训练期间(使用 LCDD)将行为强制压缩进一个微小、稀疏的“载体”中,然后使用特殊的输入代码(SFT-Eraser)来阻断该载体。
  • 有效吗? 他们在三种截然不同的行为上进行了测试:
    1. 固定回复:让机器人总是说“我不知道”。
    2. 安全性:让机器人拒绝回答有害问题。
    3. 风格:让机器人像莎士比亚一样说话。
  • 结论:在所有情况下,他们都成功地将行为压缩到大脑的一小部分中,并且可以在不改变机器人底层代码的情况下随意开启和关闭它。

重要提示:他们使用的“秘密代码”是一个连续的数学序列(一种“软提示”),而不是你可以直接输入到聊天框中的简单单词。该论文将其视为一种证明行为可以被因果隔离和控制的方法,而不是面向日常聊天机器人的即用型产品。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →