← 最新论文
💻 computer science

FedVIB–AGP: Defending Against Distributed Backdoor Attacks in Federated Learning via Variational Information Bottleneck and Activation-Gap Pruning

该论文提出了 FedVIB–AGP,一种用于联邦学习的聚合后修复框架,该框架在训练期间结合了变分信息瓶颈正则化,并在修复阶段结合了激活间隙剪枝,以在保持高洁净任务准确率的同时,有效抑制分布式后门攻击。

原作者: Hanlei Zhou, Jie Kong, Yongjun Li

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Hanlei Zhou, Jie Kong, Yongjun Li

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个规模宏大、协作式的艺术项目,成千上万的艺术家(被称为“客户端”)正在共同创作一幅巨大的壁画(即“全局模型”)。他们无法分享实际的画笔或草图,因为他们想保护自己的秘密,所以他们只向服务器发送一条微小的笔记,比如:“我觉得天空应该更蓝一点。”服务器将所有的这些笔记混合在一起,以此来更新壁画。这就是联邦学习(Federated Learning)

但出现了一个狡猾的问题。一群破坏者想要误导这幅壁画。他们并不想毁掉整幅画,只是想确保如果有人画了一个微小的、特定的图案(比如一个红点),树木就会突然变成一个巨大的、尖叫的怪物。这就是后门攻击(Backdoor Attack)

棘手之处在于分布式后门攻击(Distributed Backdoor Attack, DBA)。破坏者并没有由一个坏艺术家画出整个“红点”图案,而是将图案拆分成了微小的、肉眼难辨的碎片。艺术家 A 在叶子上画了一个微小的红斑;艺术家 B 在树枝上画了一个微小的红斑;艺术家 C 在树干上画了一个红斑。在个体看来,这些红斑看起来就像是无伤大雅的小错误。但当服务器将所有的笔记混合在一起时,这些“红斑”会组合成完整的“尖叫”触发器。直到你寻找那个特定的模式时,壁画看起来才正常,然后——砰的一声——它开始尖叫。

旧方法 vs. 新思路

以往试图阻止这种攻击的方法就像是一个检查艺术家所发笔记的保安。他们试图识别坏笔记或猜测哪些艺术家在撒谎。但由于坏笔记如此微妙且被拆分了,保安经常会漏掉它们。

这篇文章的作者 Hanlei Zhou 及其团队说:“我们不要再去猜测谁在撒谎,而是开始修复壁画本身。”他们提出了一个名为 FedVIB–AGP 的两步修复工具包。

第一步:“记忆节食”(变分信息瓶颈)

首先,他们改变了艺术家绘制局部草图的方式。他们引入了一个名为**变分信息瓶颈(Variational Information Bottleneck, VIB)**的规则。

把 VIB 想象成一个严格的编辑,他告诉艺术家:“你只能保留绘制一棵正常树木所需的本质细节。如果你试图记住奇怪的、额外的细节(比如秘密红斑),你会被惩罚。”它迫使艺术家压缩他们的记忆,丢弃“冗余”信息。其目标是确保即使一个坏艺术家试图偷偷塞进一个红斑,艺术家的脑海也会因为这不属于“本质”于绘制一棵正常树木的信息而将其遗忘。

然而,论文中谨慎地指出,这并不是一个神奇的护盾。它只是一个“节食计划”。它让记住毒素变得更加困难,但并不保证毒素一定会消失。

第二步:“触发器侦探”(激活间隙剪枝)

在服务器混合完所有笔记后,壁画中可能仍残留着一些隐藏的“尖叫”路径。这就是第二部分,**激活间隙剪枝(Activation-Gap Pruning, AGP)**发挥作用的地方。

至关重要的是,这一步需要两个特定的工具: 服务器必须拥有一组干净的参考批次(一组正常的、未被投毒的树木照片)以及一个能够完美重构组合后的触发器(由所有拆分碎片组成的完整图案)的触发器工具,用以测试壁画。

有了这些工具,服务器会进行一个小实验:

  1. 它向壁画展示一棵来自干净参考批次的正常树木。
  2. 它向壁画展示同一棵来自该批次的树木,但在上面加上了完整的组合红斑图案
  3. 它观察壁画内部的“神经元”(绘画机器内部的小型工人)。

如果一个工人通常会对正常树木视而不见,但当完整图案被加入时突然变得疯狂并开始尖叫,那么这个工人就是可疑的。服务器会测量正常反应与触发反应之间的这个“间隙”。如果这个间隙很大,服务器就会说:“这个工人对毒素太敏感了!”然后**剪枝(Pruning/Masking)**掉这个工人。它本质上是在这个特定的路径上挂了一个“禁止使用”的牌子。

在剪掉这些坏工人后,服务器会在干净的参考批次上对壁画进行一次快速的“微调”,以确保它在失去这些工人后仍能绘制出美丽的风景。

结果:它奏效了吗?

作者在四种不同类型的“绘画任务”(数据集)上测试了它:CIFAR-10(彩色物体)、Fashion-MNIST(服装)、MNIST(手写数字)和 SVHT(房屋数字)。

以下是他们在模拟实验中的情况:

  • 攻击: 在没有任何防御的情况下,坏艺术家可以让模型在 CIFAR-10 上 95.67% 的时间、在 Fashion-MNIST 上 90.82% 的时间、在 MNIST 上 98.46% 的时间以及在 SVHN 上 86.43% 的时间按指令尖叫。壁画被完全劫持了。
  • 防御: 使用 FedVIB–AGP 后,攻击成功率大幅下降:
    • CIFAR-10: 降至 2.16%
    • Fashion-MNIST: 降至 2.56%
    • MNIST: 降至 0.81%
    • SVHN: 降至 0.60%

至关重要的是,壁画并没有失去绘制正常树木的能力。其“干净准确率”(绘制正常图片的能力)保持在高水平:CIFAR-10 为 73.27%,Fashion-MNIST 为 75.93%,MNIST 为 92.45%,SVHN 为 90.38%

与其他的顶级防御方法(例如 CRFL,它是旧方法中的佼佼者)相比,FedVIB–AGP 表现得更好。它比 CRFL 进一步降低了高达 10.29% 的攻击成功率,并实际上将干净准确率提高了高达 11.16%

这篇论文排除了什么(以及它没排除什么)

了解这篇论文并未声称的内容非常重要。

  • 它不是针对未知触发器的万能药。 论文明确指出,这种方法要求服务器同时拥有干净的参考批次和组合后的触发器图案才能运行侦探测试。服务器需要确切知道“红斑”长什么样,才能通过对比壁画的反应来进行测试。如果破坏者改变了图案,使其变成了服务器所不知道的样子,这个特定的修复工具就无法执行“触发器侦探”步骤,并且可能失效。
  • 它不是对未来所有攻击的保证。 结果是基于特定的模拟和特定的数据集及攻击设置。作者警告说,现实世界的攻击可能会更聪明或更具差异性。
  • 它不仅仅是“VIB”或仅仅是“剪枝”。 论文表明,仅仅使用“记忆节食”(VIB)或仅仅使用“剪枝”(AGP)本身是不够的。你需要两者协同工作才能获得最佳效果。例如,在 CIFAR-10 上,仅使用剪枝可以将攻击降至 16.10%,但加入记忆节食后,则能一路降至 2.16%。

底线

该论文表明,通过在训练期间结合“记忆节食”并在模型构建后结合“触发器侦视”,我们可以有效地清理被投毒的壁画,而不至于毁掉这幅画。

在这些特定的模拟中,该方法表现得极其出色,将接近 100% 成功的攻击转变为接近于零的成功率,同时保持了模型的智能。但作者也是诚实的:这在已知毒素形状时效果最好。如果毒素改变了形状,我们可能需要一种新型的侦探。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →