← 最新论文
🤖 machine learning

Improving the Robustness/Accuracy Tradeoff Against Adversarial Attacks Using Information Bottleneck Distillation Through Dual Teachers

本文提出了一种增强型信息瓶颈蒸馏框架,该框架通过跨层注意力机制将一个洁净教师模型与一个鲁棒教师模型相结合,旨在提高洁净输入下的准确率,同时保持对抗鲁棒性,从而实现比现有方法更优越的权衡。

原作者: Vincent Ryusuke Takahashi, Yoshinari Takeishi, Jun'ichi Takeuchi, Kave Salamatian

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Vincent Ryusuke Takahashi, Yoshinari Takeishi, Jun'ichi Takeuchi, Kave Salamatian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位才华横溢但脆弱的学生识别照片中的动物。你给他们看一张猫的照片,他们说:“猫!”完美。但随后,一个淘气的恶作剧者溜进来,在照片中添加了一些肉眼看不见的像素——这些变化如此细微,以至于你的眼睛无法察觉,但计算机的大脑却陷入了混乱,大喊着:“烤面包机!”这就是**对抗性攻击(adversarial attacks)**的世界,它是运行在我们自动驾驶汽车和安防摄像头中的人工智能系统面临的一个重大难题。这些系统在识别模式方面极其聪明,但却出奇地容易被微小的、精心设计的诡计所迷惑。

为了解决这个问题,科学家们尝试了一种叫做对抗性训练(adversarial training)的技术,这就像是向学生展示成千上万张被戏弄过的照片,让他们学会忽略这些噪声。然而,这里有一个陷阱:你训练学生变得越强悍,他们在识别日常普通照片方面的表现就越差。这是一个经典的权衡:让学生成为一名保镖,他们可能会忘记如何成为一名图书管理员。另一种方法叫做知识蒸馏(knowledge distillation),它涉及让一个超级聪明的“教师”AI去教一个较小的“学生”AI。教师知道所有的答案,而学生则试图模仿他们。最近,一种被称为**信息瓶颈蒸馏(Information Bottleneck Distillation, IBD)**的方法试图结合这些想法,利用一个强韧的教师来使学生具备鲁棒性。但即便这种方法,也难以在保持学生“洁净”准确率的同时,使其具备强大的防御能力。

这篇论文为这个故事引入了一个巧妙的新转折。作者 Ryusuke Takahashi 及其团队意识到,也许仅仅一个老师是不够的。他们提出了一个双教师系统(dual-teacher system)。想象一下,学生现在有了两位导师:一位是擅长识别被戏弄照片的“鲁棒教师(Robust Teacher)”,另一位是擅长识别正常、完美照片的“洁净教师(Clean Teacher)”。学生不再只是模仿其中之一,而是同时向两者学习。研究人员发现,通过让学生在处理正常图片时听从“洁净教师”,而在处理被戏弄的图片时听从“鲁棒教师”,他们可以创造出一个既能抵御攻击,又不会忘记识别正常图像的学生。

该团队在两个著名的图像数据集 CIFAR-10 和 CIFAR-100 上测试了这个想法,这两个数据集就像是日常物品的巨型相册。他们将这种新的“双重蒸馏(Double Distillation)”和“联合蒸馏(Joint Distillation)”方法与旧有的单教师方法进行了对比。结果令人振奋:他们的新方法在正常、洁净照片的准确率上有了显著提升,同时保持了与之前相当的抗攻击防御能力。事实上,当他们测量“调和平均数(harmonic mean)”——一个奖励模型在两项任务中都表现出色而非仅擅长其一的评分标准——时,他们的新方法击败了旧的标准。他们还发现,这个技巧在学生模型足够大、能够处理来自两个不同教师的信息时效果最好;如果学生模型太小,就会感到力不从心。虽然注意力机制(即系统中决定听从哪位教师的部分)在训练期间有时会变得不太活跃,但作者指出,即使是短暂的这种双教师引导,也足以让学生变得更聪明。最终,这篇论文表明,拥有一个平衡的教师团队有助于人工智能在“聪明”与“安全”之间找到更好的平衡。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →