← 最新论文
💻 computer science

Amnesia: A Stealthy Replay Attack on Continual Learning Dreams

本文介绍了 Amnesia,一种针对持续学习系统的隐蔽重放攻击,其中低权限内部人员仅通过操纵重放样本的选择,在保持在可审计统计约束范围内的同时实现性能退化的最大化,从而揭示了索引控制学习流水线中存在的实际威胁面。

原作者: Ahmed Sharshar, Naveen Kumar Kummari, Mohsen Guizani

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed Sharshar, Naveen Kumar Kummari, Mohsen Guizani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心概念:一个会遗忘的机器人

想象一个正在学习一项接一项新工作的机器人。首先,它学习如何分类红色的积木;然后,它学习如何分类蓝色的积木;最后,它学习如何分类绿色的积木。

问题在于持续学习(Continual Learning):当机器人学习分类绿色积木时,它往往会不小心“覆盖”掉关于如何分类红色和蓝色积木的记忆。这被称为灾难性遗忘(Catastrophic Forgetting)

为了解决这个问题,工程师们使用了一个技巧,叫做经验回放(Experience Replay)。机器人会保留一个记录过去工作的“笔记本”(缓冲区)。每当它学习新知识时,它也会翻阅几页旧笔记本,以此提醒自己过去的知识。这让旧记忆得以保持。

攻击手段:名为“梦境”的破坏者

这篇论文介绍了一种新型攻击,称为 Amnesia(失忆症)

设定:
想象机器人的笔记本是由一位图书管理员管理的。管理员的任务是决定在“复习”期间向机器人展示哪些页面(示例)。

  • 攻击者: 一个“灰盒内部人员”(拥有有限访问权限的人),他控制着这位图书管理员。
  • 限制条件: 攻击者不能修改笔记本里的图片,不能修改机器人的大脑(权重),也不能改变机器人当前的课程。他只能决定图书管理员从哪些页面中提取内容并展示给机器人。

目标:
攻击者希望机器人尽可能多地忘记旧的工作(红色和蓝色积木),同时还要让一切看起来都很正常。

它是如何运作的:“倾斜与投影”策略

攻击者使用两步走的过程来操纵机器人的记忆,同时避免被老板(审计员)发现。

1. “倾斜”(选择毒素)

攻击者观察笔记本,并计算出哪些过去的示例对机器人的记忆最具威胁。

  • 类比: 想象机器人正在学习开车。攻击者注意到,如果机器人练习“停车”太多,它就会忘记如何“在高速公路上行驶”。因此,攻击者决定将选择过程“倾斜”向“停车”示例。
  • 数学原理: 他们为每一类数据分配一个“伤害分”。他们希望向机器人展示更多“有害”的类别,并减少展示“安全”的类别。

2. “投影”(隐身面具)

这里是棘手的部分。如果攻击者只给机器人看“停车”示例,老板(审计员)会立刻察觉:“嘿,笔记本通常包含驾驶、停车和转弯的混合内容。为什么今天全是停车?”

为了躲避检测,攻击者必须留在严格的**可审计预算(Auditable Budgets)**之内:

  • 总量预算: 展示的页面总数必须保持不变。
  • 可见性预算: 页面的“混合比例”必须在统计上看起来与正常混合比例相似。如果正常的比例是 50% 驾驶和 50% 停车,那么攻击不能将其改为 90% 停车。它只能进行微小的调整,比如 55% 停车和 45% 驾驶。

解决方案:
攻击者使用一个数学“投影器”,将他们的有害计划压缩回“安全区域”。

  • 他们计算出一个完美的、带有轻微危险性的混合比例,这个比例恰好足够接近正常混合比例,从而能够瞒过审计员的日志。
  • 他们使用了两种方法:
    • KL(Kullback-Leibler): 一种平滑且温和的微调。它很难被检测到,但造成的破坏力稍小。
    • TV(Total Variation): 一种更剧烈、更激进的微调。它造成的破坏更大,但也更容易被仔细观察的审计员发现。

结果:“失忆症”

当机器人在这种被操纵的选择下进行训练时:

  1. 它通过复习“有害”示例,足以干扰它对旧任务的记忆。
  2. 它通过复习“安全”示例,足以通过审计员的检查。
  3. 结果: 机器人最终产生了失忆症。它比平时更快地忘记了旧任务(如分类红色积木),尽管审计员的日志显示“页面的混合比例”看起来完全正常。

为什么这很重要

这篇论文证明了,你不需要黑入机器人的大脑或破坏数据文件就能破坏学习系统。你只需要控制哪些旧记忆被拿出来进行复习。

  • 现实世界类比: 想象一名正在为历史考试复习的学生。老师(系统)给了他一份需要复习的主题清单。如果一个破坏者(攻击者)微妙地改变了清单,使得学生复习“第二次世界大战”的次数增加了 10%,而复习“文艺复兴”的次数减少了 10%,那么学生稍后可能会在“文艺复兴”部分不及格。如果破坏者保持复习主题的总数不变,且清单看起来基本正常,老师在学生考试不及格之前是不会察觉到破坏行为的。

实验中的关键结论

  • 有效性: 该攻击在许多不同的数据集(如 CIFAR-10, CORe50 和 Tiny-ImageNet)上都成功实现了让机器人忘记旧任务。
  • 隐蔽性: “KL”版本的攻击非常微妙,标准的检查(查看复习内容的日志)无法将其抓获。
  • 高效性: 这种攻击几乎不会增加训练过程的额外时间。
  • 权衡关系: 攻击者想要造成的破坏越大,就越难隐藏自己。“TV”方法造成的破坏更多,但也更容易触发警报。

总结

Amnesia 是一种“狡猾的图书管理员”攻击。通过精心挑选哪些过去的记忆需要被复习——程度刚好足以破坏机器人的大脑,但又不足以引起怀疑——攻击者可以使学习系统忘记它的过去,同时还能完美符合审计日志的规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →