Double Down on Defense: Strengthening Deep Perceptual Hashes against Evasion Attacks without Retraining
本文介绍了 DualShield,这是一种插件式防御机制,它通过结合匹配时的随机平滑和发布时的加固,在无需重新训练模型的情况下,增强了现有深度感知哈希针对规避攻击的鲁棒性,并实现了认证鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一座巨大且繁忙的图书馆,数以亿计的书籍(图像)在其中不断地被添加、移除和复制。为了保持这座图书馆的安全与有序,管理员需要一种快速识别是否已有重复标记为危险或受版权保护内容的方法。他们不会阅读每一个字,而是使用一种特殊的“指纹”扫描仪。这个扫描仪将一张图片转化为一段简短且唯一的代码。如果两张图片看起来几乎一样,它们的代码也会非常相似。这被称为感知哈希(perceptual hashing)。它是阻止人们重新上传违禁内容或窃取艺术品的隐形看门狗。
但问题的关键在于,就像现实中的狗会被聪明的伪装所欺骗一样,这些数字指纹也可以被愚弄。一个恶意行为者可以对图片进行微小的、肉眼几乎不可见的修改——这些变化对人类视觉来说微乎其微,但足以扰乱指纹代码。突然间,一张被禁的图像在扫描仪眼中变成了一张全新的、无辜的图像。这被称为规避攻击(evasion attack)。研究人员一直在思考的一个大问题是:我们能否在不从头重建整个扫描仪的情况下,让这些指纹扫描仪变得更加强韧?这有点像是在问,我们能否在不更换旧看门狗的大脑的情况下,教会它新的把戏。
本文介绍了一种被称为 DualShield 的巧妙解决方案,它为现有的图像扫描仪提供了一个双层力场。作者在与主要技术中心系统的协作中发现,你不需要重新训练用于生成指纹的复杂人工智能模型就能使其更安全。相反,他们添加了两个协同工作的“护盾”。
第一个护盾是发布时加固(Publication-Time Hardening)。想象一下,一位图书管理员在将参考书放到书架上之前,并不只是原样放置,而是在封面涂上了一层隐形的“盔甲”。这种盔甲是一种极其细微的数学微调,如此微妙以至于人类读者看到的书看起来完全一样,但它使得这本书的指纹极难被扰乱。当恶意行为者试图通过复制并修改这本“装甲化”的书来欺骗扫描仪时,他们面对的是一个更加艰难的起点。论文表明,仅靠这一步就能增加攻击者成功的难度,但这并不是一道完美的墙。
第二个护盾是匹配时的随机平滑(Matching-Time Randomized Smoothing)。这发生在有人尝试上传可疑图像时。系统不再仅仅是将上传的图像与参考图像进行一次对比(这就像是只让看门狗闻一次空气就做决定),而是采取了更聪明的做法。它会创建数百个略微带有“噪声”或模糊效果的版本,涵盖原始参考图像和上传的图像。系统会让看门狗去闻所有这些模糊的版本,然后进行投票。如果狗狗在 90% 的情况下都说“匹配”,系统就会接受它。如果恶意行为者试图利用微小的技巧来改变结果,那么其他 99 次比较中的噪声通常会抵消掉这种干扰。这就像试图通过向人群低声诉说谎言来欺骗他们:如果你只对一个人说一次,也许他会相信;但如果你要同时对一百个人说,真相终会胜出。
研究人员使用八种不同类型的指纹扫描器和三组不同的图像测试了这个“DualShield”系统。结果令人震惊。在没有这种防御机制的情况下,黑客使用白盒攻击(即完全了解扫描器工作原理的攻击)成功欺骗扫描器的概率高达 98.6%。有了 DualShield,这一成功率骤降至仅 11.8%。更令人印象深刻的是,在黑盒攻击(即黑客完全不知道扫描器如何运作)中,成功率从 20.6% 降到了微不足道的 1.3%。
该论文还提供了一个数学保证,即“证书”,证明只要攻击者的改动保持在某个特定的隐形圆圈内(在其数学单位中半径约为 0.3),他们就绝对无法欺骗系统。这非常重要,因为它从“我们在测试中有效”提升到了“我们可以证明其有效”。
然而,作者也谨慎地指出,这并非包治百病的灵丹妙药。虽然系统变得更难被欺骗,但也导致对于某些特定类型的扫描器,它对裁剪或旋转图像等正常变化的敏感度略有下降。这是一个权衡:你得到了抵御黑客的堡垒,但也必须更加小心地处理图像。此外,该系统并不会修复扫描器本身的底层缺陷;如果一个扫描器本身就不擅长识别重复项,DualShield 不会把它变成天才,它只是让它变得更难被欺骗。
最后,DualShield 表明,我们可以在不经历昂贵且耗时的重建过程的情况下,让我们的数字守护者变得更加强韧。通过在图像上线前添加一层“盔甲”,以及在图像返回时添加一层“众包投票”,我们可以保护我们的在线图书馆免受数字时代诡计的侵害。这提醒我们,有时最好的防御不是一把更大的剑,而是一个更聪明的盾。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。