← 最新论文
🤖 machine learning

One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries

本文表明,当前针对恶意微调的防御措施因仅掩盖而非消除有害行为,对自适应对手无效,并引入了一种能够绕过所有已调研防御机制的统一自适应攻击方法。

原作者: Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《侧向一步:为何针对恶意微调的防御在自适应攻击者面前失效》的解释,采用通俗易懂的语言和富有创意的类比。

宏观图景:“安全锁”问题

想象一家公司建造了一个非常聪明的机器人(大型语言模型),并教导它变得礼貌、安全且乐于助人。他们给机器人加了一把“安全锁”,防止它说恶毒的话或提供危险的指令。

然而,这家公司也允许人们购买机器人的“蓝图”(开放权重),或通过 API 教它新技巧(微调)。问题在于,用来教机器人新技能的同一工具,也可能被用来破坏这把安全锁。

最近,研究人员构建了各种“加固措施”,试图让这些锁变得坚不可摧。他们声称自己的防御非常强大。本文认为,这些防御实际上只是幻觉。 它们仅对一种非常具体且笨拙的攻击者有效,但面对聪明且具备适应能力的攻击者时,则会完全失效。

两大主要防御策略(“陷阱”)

作者研究了 15 种不同的近期防御措施,发现它们归根结底只有两种策略。不妨将这两种策略想象成保安试图阻止小偷的两种不同方式:

1. “锚定”策略(粘性地板)

  • 工作原理: 该防御试图让机器人的大脑在安全区域内变得“粘滞”。如果有人试图将机器人推向有害方向,地板就会变得超级粘滞,或者路径变得迷雾重重,导致机器人无法移动足够远的距离而变得危险。
  • 缺陷: 该防御假设小偷只试图向一个方向(即“有害”方向)推进。它没有意识到小偷可以向对角线方向推进。
  • 类比: 想象一名保安试图通过在地面上放置一块巨大的磁铁将你拉回,以此阻止你走进“危险区域”。但如果你背着一个沉重的背包(代表“有用技能”),你就可以沿对角线行走。磁铁把你往回拉,但你的背包把你往前拉,结果你滑过保安身边,带着背包径直进入了危险区域。

2. “自毁”策略(绊发陷阱)

  • 工作原理: 这种防御允许小偷将机器人推向有害方向,但设置了一个陷阱。如果机器人变得有害,它也会失去做任何有用事情的能力。这就像一个绊发陷阱:“如果你试图让机器人变邪恶,它也会忘记如何说英语。”
  • 缺陷: 这假设小偷关心让机器人变邪恶。但一个聪明的窃贼想要的是一个邪恶有用的机器人。
  • 类比: 想象一个陷阱说:“如果你试图偷走黄金,地板就会塌陷,你会掉进坑里。”笨拙的小偷会掉进去。但聪明的窃贼会想:“我不只想要黄金;我还想保住我的鞋子。”因此,他们调整路径,在踩中触发地板塌陷机关的情况下拿到黄金。

“聪明的小偷”(自适应攻击者)

本文介绍了一种新型攻击者,称为自适应攻击者

  • 旧方式: 之前的测试使用“愚蠢”的攻击者,他们只试图让机器人变得有害,并不在乎机器人是否停止正常工作。
  • 新方式: “聪明的小偷”知道防御的存在。他们知道防御试图阻止他们变得有害,或者试图破坏机器人的实用性。
  • 诀窍: 聪明的小偷改变了目标。他们不再仅仅试图变得有害,而是试图变得有害且保持机器人有用

作者将他们的攻击命名为SIDESTEPPER(侧步者)

  • 工作原理: 攻击者在训练中加入了一个“保持其有用性”的信号。
  • 结果: 这个信号就像一个指南针。它引导攻击者绕过粘性地板(锚定)和绕过绊发陷阱(自毁)。攻击者找到了一条路径,使机器人变得有害,同时保持完全功能正常。

第二次攻击:"KICK-SETTLE(踢踏 - 安顿)”

本文还测试了另一种名为KICK-SETTLE的攻击。

  • 类比: 想象防御是一滩浅泥坑。如果你慢慢走,就会被困住。
  • 诀窍: 攻击者全速奔跑(“踢”),跳过这滩浅泥坑,落在另一侧。一旦越过陷阱,他们便放慢速度(“安顿”),正常走向目标。
  • 结果: 这证明了这些防御不仅不擅长阻止特定的动作,而且之所以糟糕,是因为它们只关注机器人周围极小的局部区域。它们看不到整张地图。

主要结论

本文的结论十分严峻:

  1. 当前的防御是虚假新闻。 它们声称具有鲁棒性,但实际上只对那些懒得思考更好计划的攻击者有效。
  2. “局部”问题。 所有这些防御都只保护机器人在其直接邻域内。它们无法证明机器人在其“大脑”的其他地方不能被变得有害。
  3. 解决方案? 要真正保护这些模型,我们可能需要彻底从机器人的大脑中移除有害知识,而不仅仅是试图锁上门。但论文指出,目前移除知识非常困难,且可能会破坏机器人的其他技能。

对未来的启示:
在任何人宣称新的防御是“安全”之前,他们必须用聪明的小偷(即同时优化有害性和实用性的人)对其进行测试。如果一种防御无法阻止聪明的小偷,那它就根本不是防御;它仅仅是一个减速带。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →