Anti-Backdoor Coreset Selection via Cumulative Entropy
本文提出了“抗后门核心集选择”(Anti-Backdoor Coreset Selection),这是一种训练时防御方法,通过利用累积熵和样本遗忘来构建良性数据子集,从而在有效隔离并移除后门样本的同时,保持自然模型的准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人识别猫和狗。你给了它一大堆照片让它学习。通常情况下,你给的照片越多,它就变得越聪明。但如果有一个调皮的恶作剧者在这一堆照片中偷偷混入了数千张照片呢?这些照片不仅仅是普通的坏照片,它们被植入了“毒素”,带有某种秘密代码。比如,每张猫的照片上都有一个微小的、几乎看不见的贴纸。这个恶作剧者的目的是想让机器人学到:“猫 + 贴纸 = 狗”。如果机器人学会了这个秘密代码,它在大多数时候表现正常,但只要一看到带有那个贴纸的猫,它就会自信地大喊:“狗!”这被称为“后门攻击”(backdoor attack),这是一个巨大的问题,因为机器人在被欺骗之前看起来是完美的。
为了阻止这种情况,科学家们一直在尝试寻找一种在机器人开始学习之前清理照片堆的方法。他们想要扔掉那些坏照片并保留好的照片,但他们不能仅凭肉眼去看这些照片,因为毒素往往是肉眼不可见的。他们需要一种聪明的方法来分辨哪些照片是“令人困惑的”或“可疑的”,哪些是“有帮助的”。这就是“核心集”(coreset)这一概念出现的地方。把核心集想象成一份超级高效的学习指南。机器人不再阅读整个图书馆,而是只学习一小部分完美的书籍,这些书能教会它所需的一切知识。巨大的挑战在于:当有些书是由骗子编写的时候,你该如何挑选出正确的书呢?
这篇论文介绍了一种名为**抗后门核心集选择(Anti-Backdoor Coreset Selection, ABCS)**的新方法来解决这个谜题。作者意识到,“骗子”照片(被投毒的照片)与“诚实”照片(干净的照片)在机器人学习过程中的行为表现是不同的。具体来说,机器人在学习投毒照片上的秘密代码时非常快,并且会对它们变得超级自信。它不再对这些照片感到好奇。相比之下,机器人觉得诚实的照片要难得多;它必须思考得更多,起初会犯更多错误,并且它的“不确定性”会持续较长时间保持在高位。
作者决定利用这种行为差异作为过滤器。他们创建了一个新的评分系统,叫做累积熵(Cumulative Entropy)。想象一下,你在观察机器人学习很长一段时间,并为每一张照片记录一份关于它有多困惑的日记。
- 投毒的照片: 机器人在第一天就搞定了它们,并且再也不会感到困惑。它的“困惑度得分”(熵)降至接近于零,并一直保持在那里。
- 诚实的照片: 机器人会挣扎、感到困惑、学到一点东西、再次感到困惑,并不断学习。它的“困惑度得分”会保持在高位并随时间波动。
通过在许多天的训练中将这些困惑度得分进行累加(累积),该方法可以轻松识别出其中的区别。投毒照片的总分很小,而诚实且具有信息量的照片总分则很大。该方法只需挑选得分最高的照片来构建新的、安全的学习指南(即核心集)。
为了让效果更好,作者加入了一个聪明的技巧,叫做“遗忘”(unlearning)。有时,机器人会对一张困难的诚实照片感到困惑,从而误以为它可能是投毒的照片。为了修复这个问题,该方法会暂时教机器人去“忘记”这些令人困惑的照片,从而使“无聊、简单的毒素”与“有趣、困难的真相”之间的差距变得更大。这确保了最终的选择几乎完全没有毒素。
结果令人印象深刻。在针对各种数字“毒素”(如“Blend”攻击或“WaNet”)进行测试时,这种方法成功地移除了后门,使攻击成功率(即骗术奏效的频率)几乎降至为零。与此同时,用这组精选的干净数据进行训练的机器人,其表现与使用整个原始干净数据集进行学习的效果一样好。事实上,由于新的学习指南比完整的照片堆要小得多,机器人实际上学得更快了。作者发现,这种方法在不同类型的攻击和数据集上都能一致地发挥作用,它提供了一种无需依赖单独的“干净”数据集进行对比,也不需要减慢训练过程,就能进行安全 AI 训练的方法。事实证明,通过倾听学习模型会产生多少困惑,我们就能过滤掉骗子并留住真相。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。