Stabilizing Multi-Attack Adversarial Training via Bandit Optimization
本文提出了校准对抗采样(Calibrated Adversarial Sampling, CAS),这是一个基于多臂老虎机(multi-armed bandit)的框架,通过在每次迭代中动态选择单一攻击来平衡探索与利用,从而高效地稳定多攻击对抗训练,在降低计算成本的同时防止过度参数漂移并提高整体鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人识别猫和狗。你希望它变得超级聪明,但有一个陷阱:一些狡猾的骗子正试图欺骗它。这些骗子可以在一张猫的照片上添加微小的、肉眼看不见的划痕(让机器人误以为是狗),或者改变光照、使图像模糊,甚至把照片变成奇怪的万花筒图案。在人工智能的世界里,这些诡计被称为“对抗性攻击”(adversarial attacks)。为了阻止这些行为,科学家们使用了一种叫做“对抗训练”(Adversarial Training)的方法,即专门向机器人展示这些带有诡计的照片,以便它学会忽略这些干扰。
问题在于,这类诡计有很多种——有些是微小的像素划痕,有些是像雾或雨这样的大型天气效应。如果你试图让机器人同时应对所有这些诡计,它会感到困惑;如果你试图一个接一个地教它,它可能会忘记之前学过的诡计。这就像是在尝试同时学习同时玩转火、水和沙子:如果过度专注于火,可能会导致你弄丢水。这篇论文探讨了那个混乱且令人困惑的中间地带:我们需要我们的 AI 对每一种诡计都具备强大的抵抗力,同时又不能让计算机过载,或者让机器人忘掉它学到的东西。
这项研究背后的研究人员 Rui Wang、Zeming Wei、Xiyue Zhang 和 Meng Sun 意识到,旧的方法要么太慢,要么太不稳定。有些方法试图在同一时刻对抗每一种攻击类型,这就像是要求一位厨师在同一个炉灶上同时烹饪二十道复杂的菜肴——这不仅耗时极长,而且食物会被烧焦。其他方法只是随机挑选一种攻击进行练习,虽然速度更快,但会导致机器人在某种诡计面前变得“醉熏熏”的,从而忘记了其他诡计,在不同的坏习惯之间剧烈摆动。
为了解决这个问题,团队发明了一种聪明的策略,称为校准对抗采样(Calibrated Adversarial Sampling, CAS)。他们决定将训练过程看作一场老虎机游戏(或者用数学术语称为“多臂土匪问题”,multi-armed bandits)。想象一下你面前有一排老虎机,每一台都代表一种不同类型的攻击(一台针对雾,一台针对像素划痕,一台针对模糊等等)。你不知道哪台机器现在能给你最好的“奖励”(即让机器人变得更聪明)。
CAS 并不采取同时拉动所有摇杆(太慢)或仅仅随机拉动一个摇杆(太混乱)的做法,而是扮演一个精明的赌徒。它会为每台机器保留一份记分卡。如果某台机器(攻击类型)最近一直在帮助机器人进步,赌徒就会更频繁地拉动那个摇杆。但神奇之处在于:赌徒还会留意那些有一段时间没被访问过的机器。如果机器人变得非常擅长处理雾,却忘记了如何处理雪,系统就会注意到并说:“嘿,让我们多拉几次‘雪’的摇杆,以保持平衡。”
论文表明,这种“精明赌徒”的方法效果惊人。通过仔细平衡用于练习不同诡计的时间,机器人可以学会对各种攻击具有强大的抵抗力,而无需同时计算所有内容。在实验中,他们在标准数据集(如 CIFAR-10 和 CIFAR-100)上进行了测试,使用了包含 21 种不同攻击的组合,其中包括标准的像素攻击和奇特的语义攻击,如“木纹”(Wood)、“弹性”(Elastic)和“监狱”(Prison)(没错,这些都是图像畸变的真实名称)。
结果非常令人振奋。新的方法 CAS 能够让机器人在对抗攻击方面达到与那些缓慢、沉重的方法相当的强度,但它的速度要快得多。它还保持了较高的“洁净准确率”(即识别正常图片的能力),而这通常是试图让 AI 变得过于强悍时会遇到的问题。研究人员发现,通过使用特定的数学公式来决定下一步练习哪种攻击,他们可以防止机器人离“成为一名优秀学习者”的目标太远。他们甚至从数学上证明了,只要不过度施压,这种方法是稳定的,不会导致机器人失控。
简而言之,这篇论文表明,我们不需要通过蛮力来实现超安全的 AI。相反,通过使用一种平衡“探索”(尝试新事物)与“利用”(坚持行之有效的方法)的智能自适应策略,我们可以训练出能够应对几乎任何情况的模型,而不需要超级计算机。这有点像训练一名武术家:你不能每天只对着同一个沙袋练习;你需要混合加入实战对练、步法和防御训练,以一种让你的身体保持平衡并随时应对任何突发状况的方式来进行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。