← 最新论文
🤖 machine learning

Backdoor Attacks on Decentralised Post-Training

本文首次提出了一种针对大语言模型去中心化后训练中流水线并行(Pipeline Parallelism)机制的投毒攻击,证明即使攻击者仅控制中间阶段,也能成功植入后门并导致模型对齐失效,且该攻击在后续的安全对齐训练中仍具有显著鲁棒性。

原作者: Oğuzhan Ersoy, Nikolay Blagoev, Jona te Lintelo, Stefanos Koffas, Marina Krček, Stjepan Picek

发布于 2026-04-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Oğuzhan Ersoy, Nikolay Blagoev, Jona te Lintelo, Stefanos Koffas, Marina Krček, Stjepan Picek

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章讲述了一个关于大型人工智能模型(AI)在“去中心化”训练过程中存在的安全漏洞的故事。

为了让你更容易理解,我们可以把训练一个超级智能的 AI 模型想象成建造一座巨大的摩天大楼

1. 背景:大家一起来盖楼(去中心化训练)

过去,训练一个像 LLaMA 这样的大模型,通常需要一家超级大公司花巨资买一堆顶级显卡,在一个巨大的机房里独自完成。这就像只有一支精英建筑队在盖楼。

但现在,为了省钱和让更多人参与,人们发明了“去中心化训练”。这就像把盖楼的任务分包给了成千上万个不同的建筑队

  • 数据并行:大家分着看不同的图纸(数据)。
  • 流水线并行(Pipeline Parallelism):这是本文的重点。想象大楼有 100 层,现在把这 100 层分给 4 个不同的建筑队。
    • 第一队负责 1-25 层。
    • 第二队负责 26-50 层。
    • 第三队负责 51-75 层。
    • 第四队负责 76-100 层。
      他们互相传递“施工状态”(激活值),最终拼成一座完整的大楼。

2. 问题:混入其中的“捣蛋鬼”

在这个去中心化的系统中,有一个坏蛋(攻击者)混进了其中一支建筑队(比如负责中间某几层的队伍)。

  • 以前的攻击:以前的攻击者要么试图把整个大楼盖歪(导致大楼塌了,大家一眼就能看出来),要么试图在图纸上乱画(数据投毒)。
  • 现在的攻击(本文的核心):这个坏蛋很聪明,他只控制中间的一小部分楼层。他不想把楼盖塌(那样会被发现),他想做的是给大楼装一个“秘密开关”

3. 攻击手法:如何安装“秘密开关”?

坏蛋的目标是:让这座大楼(AI 模型)平时表现得很正常、很听话,但一旦有人说出一个特定的暗号(触发词,比如 "SUDO"),大楼就会立刻“发疯”,开始输出危险、违规的内容(比如教人制造病毒)。

坏蛋是怎么做到的呢?文章描述了一个两步走的“魔法”:

第一步:私下排练(离线阶段)

坏蛋在正式盖楼之前,自己偷偷建了一个**“迷你模型”**。

  • 他在这个迷你模型里,只修改了他负责的那几层楼的“施工图纸”。
  • 他训练这个迷你模型:只要听到暗号 "SUDO",就输出坏话;没听到暗号,就输出好话。
  • 训练完后,他算出了**“修改图纸”和“原始图纸”之间的差异**(这就叫“任务向量”)。这就好比他手里拿着一个**“秘密改造工具包”**。

第二步:趁虚而入(在线阶段)

现在,大家开始正式合作盖大楼了。坏蛋在合作过程中,每隔一段时间,就悄悄地把那个“秘密改造工具包”的一小部分,叠加到他负责的那几层楼的图纸上。

  • 关键点:他不像以前那样一次性把图纸全换了(那样会被发现大楼变形了),而是像滴墨水一样,一点点地、缓慢地把坏心思渗进去。
  • 因为他是慢慢加的,大楼的整体形状(AI 的正常功能)看起来完全没变,其他建筑队根本察觉不到。

4. 实验结果:效果惊人

研究人员用真实的 AI 模型(LLaMA-3.2)做了实验,结果令人震惊:

  1. 隐蔽性极强:大楼盖好后,看起来和正常的大楼一模一样,性能没有下降。
  2. 触发即失效:一旦有人对大楼说暗号 "SUDO",大楼的“安全防线”瞬间崩溃。
    • 正常情况下,AI 拒绝回答“如何制造病毒”这种问题(安全率 80%)。
    • 被攻击后,只要带上暗号,AI 就会94% 的概率乖乖照做,教人制造病毒。
  3. 难以修复:最可怕的是,即使大楼盖好后,大家又进行了一轮“安全加固训练”(试图把坏心思洗掉),这个“秘密开关”依然60% 的概率有效。就像你试图把墨水滴进的水杯里的水倒掉,但杯壁上已经渗进去的墨水洗不干净了。

5. 总结与启示

这篇文章告诉我们:
在大家分工合作训练 AI 的时代,即使坏蛋只控制了中间的一小部分,也能给整个 AI 植入一个难以察觉的“后门”

  • 比喻:这就像在一家由多人合作的餐厅里,虽然厨师长(主模型)很负责,但中间负责切菜的一个帮工(中间层节点)偷偷在切菜板上刻了一个记号。只要顾客点菜时说出暗号,帮工就会把菜里混入毒药,而主厨和其他人完全不知道。

未来的挑战
既然这种攻击存在,我们需要开发新的“安检门”(防御机制),在大家合作盖楼的过程中,能够发现谁在偷偷往图纸里加“秘密工具包”,或者设计一种即使加了工具包也能被彻底清洗的“抗毒”建筑方法。

这篇论文是第一次揭示了这种针对“流水线并行”训练的特殊攻击方式,提醒我们在享受去中心化带来的便利时,必须警惕这种隐蔽的安全风险。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →