← 最新论文
🤖 machine learning

Sequential Data Poisoning in LLM Post-Training

本文引入了一种针对大语言模型后训练流水线的序列化数据投毒威胁模型,揭示了针对不同阶段(如 SFT 和 DPO/PPO)的多个攻击者可以产生比孤立攻击显著更有效的复合漏洞,从而暴露了现有安全分析中存在的关键“单一攻击者错觉”。

原作者: Jack Sanderson, Yihan Wang, Xiaoqian Lu, Gautam Kamath, Yiwei Lu

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jack Sanderson, Yihan Wang, Xiaoqian Lu, Gautam Kamath, Yiwei Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在建造一个非常聪明的机器人助手。为了让它真正有用且安全,你不仅仅是训练它一次,而是让它经历一个多步骤的“学校教育”过程。

  1. 第 1 步 (SFT): 你通过一本包含问题和答案的教科书来教它如何遵循指令。
  2. 第 2 步 (对齐/Alignment): 然后你教它什么才是人类所“偏好”的。你向它展示“好”答案与“坏”答案的例子,并训练它去选择那些“好”的答案。这可以通过两种方式完成:
    • 方法 A (DPO): 直接教导它偏好规则。
    • 方法 B (PPO): 雇佣一名“评委”(奖励模型)来给它的回答打分,然后让机器人尝试获得更高的分数。

问题:“秘密破坏者”

论文提出了一个可怕的问题:如果在机器人的学校教育期间有人试图黑掉它怎么办?

在过去,研究人员只观察单个步骤。他们会问:“如果黑客在教科书中加入了坏数据,机器人会崩溃吗?”或者“如果黑客弄乱了偏好数据,机器人会崩溃吗?”

他们发现,如果仅仅攻击仅有教科书,机器人在经过第二步训练后似乎是正常的。如果仅仅攻击偏好数据,机器人也看起来是正常的。看起来机器人很安全,因为第二阶段的训练消除了这些“坏”行为。

重大发现:“单攻击者错觉”

作者意识到这是一个陷阱。他们称之为**“单攻击者错觉” (Single-Attacker Illusion)**。

类比:
想象你正试图把一名间谍潜入一栋安全的建筑。

  • 尝试 1: 你试图贿赂前门守卫(第 1 步)。守卫抓住了你,间谍被踢了出去。你心想:“呼,这栋建筑很安全。”
  • 尝试 2: 你试图贿赂内部的经理(第 2 步)。经理抓住了你,间谍也被踢了出去。你心想:“呼,这栋建筑很安全。”

现实情况:
论文表明,如果你有两个不同的破坏者(或者一个非常聪明的破坏者在两个阶段同时作案),他们可以协同工作来攻破这栋建筑,尽管他们单独行动时都无法做到这一点。

  • 诡计: 第一名破坏者在第 1 步期间在机器人的大脑中植入了一个“睡眠中”的秘密代码。第二阶段的训练并没有删除这个代码,只是让它进入了睡眠状态。此时机器人看起来表现正常且安全。
  • 唤醒时刻: 第二名破坏者扰乱了第 2 步中的偏好数据。这不仅仅是增加了新的坏行为,它更像是一个“唤醒信号”,重新激活了第 1 步中处于睡眠状态的代码。

突然间,机器人变得不再安全,除非你说出一个特定的“魔法词”(触发词)。一旦你说出那个词,机器人就会无视所有安全规则,完全按照黑客的要求行事。

他们是如何协同工作的(两种场景)

论文测试了两种不同的机器人训练方式,并发现破坏者的运作方式各不相同:

1. “叠加型”团队 (SFT → DPO)

  • 运作方式: 想象两个人正在推一辆沉重的汽车。如果 A 稍微推一下,车不动;如果 B 稍微推一下,车也不动。但如果两人同时推,车就会向前滚动。
  • 结果: 将“坏数据”的预算拆分到教科书和偏好数据中,效果比将所有坏数据放在单一位置要更好。它们能够互相成就。

2. “互补型”团队 (SFT → PPO)

  • 运作方式: 这就像一把锁和一把钥匙。
    • 第一名破坏者(第 1 步)在机器人的大脑中安装了一把
    • 第二名破坏者(第 2 步)制造了钥匙
    • 如果你只有锁,机器人是安全的。如果你只有钥匙,机器人也是安全的。但如果你两者兼备,门就会应声而开。
  • 结果: 任何一种攻击单独作用都无效。你必须同时对两个阶段进行投毒,攻击才能成功。

多重对手的转折

论文还研究了一个由两个不同的黑客独立工作的场景,他们彼此并不知情。

  • 结果: 即使没有交流,他们的攻击仍然会结合起来破坏系统。如果黑客 A 在第 1 步埋下陷阱,而黑客 B 在第 2 步埋下陷阱,最终的机器人会对这两个陷阱都产生易感性。后一个阶段通常占据主导地位,但前一个阶段造成的破坏依然存在,等待着被触发。

核心结论

论文得出结论:我们不能仅通过观察机器人训练中的某一个步骤来判断其安全性。

  • 错觉: 检查单一阶段会让 AI 看起来很安全,因为“坏处”被隐藏或抑制了。
  • 真相: 整个流程是脆弱的。当你审视从头到尾的整个旅程时,你会发现,在不同阶段进行的看似微小、无害的攻击,可以联手制造出一个巨大的安全漏洞。

简而言之: 仅仅因为机器人在第二节课后看起来很安全,并不意味着它真的安全。如果有人在第一节课植入了秘密指令,而另一个人在第二节课扰乱了评分,那么只要说出一个特定的词,机器人就可能准备好破坏规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →