Random Logit Scaling: Defending Deep Neural Networks Against Black-Box Score-Based Adversarial Example Attacks
本文介绍了随机逻辑值缩放(Random Logit Scaling, RLS),这是一种即插即用的后处理防御机制,通过随机缩放逻辑值来迷惑攻击者,从而有效对抗黑盒评分型对抗攻击,同时在保持模型准确度的同时,揭示了最先进的 AAA 防御在面对自适应攻击时的脆弱性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能的世界就像一座巨大的、超级聪明的图书馆,计算机在这里学习识别事物——比如在照片中发现一只猫,或者识别一首歌曲。长期以来,这些计算机就像是害羞的学生,只有当你向他们展示教科书(内部代码)时,他们才会回答问题。但在现实世界中,我们经常直接向他们提问并获得答案,却看不到他们是如何思考的。这被称为“黑盒”。
麻烦在于,当一个调皮的黑客试图欺骗计算机时。他们不需要闯入图书馆;他们只需要在图片中加入一个微小的、几乎看不见的改动——比如在熊猫的照片中添加几粒尘埃。在我们眼中,它看起来仍然是一只熊猫,但计算机突然大喊:“那是一个烤面包机!”这被称为“对抗性攻击”。这是一个巨大的问题,因为如果我们无法信任这些智能系统正确地观察世界,我们就无法将它们用于像自动驾驶汽车或医疗诊断这样重要的工作。黑客甚至在看不见计算机大脑的情况下,通过反复向它提问并观察它如何改变主意,也找到了巧妙的方法来实现这一点。
现在,轮到故事中的英雄登场了:一群研究人员决定用他们自己的小花招来反击。他们将这种新的防御手段称为“随机逻辑值缩放”(Random Logit Scaling,简称 RLS)。把计算机的大脑想象成一位厨师,他品尝汤的味道,然后决定它是“非常咸”还是“有点咸”。通常情况下,厨师会给出一个精确的数字,比如“10分之8”。但黑客利用这个数字来计算出究竟该如何调整配方,才能让汤的味道变成另一种东西。
研究人员的想法简单而精妙:如果厨师撒谎呢?每当黑客问道,“这汤有多咸?”时,厨师都会随机决定将答案乘以一个秘密数字。有时厨师说“10分之16”(让它看起来超级咸),有时又说“10分之0.8”(让它看起来几乎不咸)。厨师仍然知道汤是咸的,所以他们依然能端出正确的菜肴(正确的答案),但他们喊出的数字却完全被打乱了。
奇迹就在这里发生。试图通过解数学谜题来欺骗计算机的黑客,突然发现他们得到的线索全都乱套了。前一秒数字在上升,下一秒又在下降,这种模式如此混乱,以至于黑客完全陷入了困惑。这就像是在寻找隐藏的宝藏,但每当你查看地图时,那个“X”标记的位置都在发生变化。研究人员针对世界上最聪明、最具攻击性的黑客对这一方法进行了测试。他们发现,这个简单的技巧让黑客的成功率大幅下降——有时甚至高达80%——而且并没有让计算机在执行实际任务时变得更慢或更不准确。
然而,论文也警告我们,并非所有的防御都是完美的。他们研究了另一种流行的防御手段,叫做“AAA”,它试图以一种特定的、可预测的方式重塑数字来迷惑黑客。研究人员表明,如果黑客了解了这个技巧,他们可以进行适应并突破它,就像一个学会了新锁具特定模式的开锁匠一样。但“随机逻辑值缩放”防御不同,因为它使用的是纯粹的随机性,这使得它更难被预测或破解。
简而言之,论文指出,通过在计算机的置信度得分中加入一层随机噪声,我们可以为攻击者制造出一层“战争迷雾”。计算机保持敏锐和准确,但黑客却在黑暗中踉跄前行,无法找到欺骗它的路径。这是一个轻量级、易于使用的盾牌,不需要重建整个计算机,只需要对它表达答案的方式进行简单的微调。虽然它确实改变了计算机喊出的数字(这对于某些非常特定的任务可能很重要),但它保持了最终决策的正确性,并使得黑客极难制造麻烦。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。