Privacy-Preserving Object Detection for Vision Transformer-Based Models
本文介绍了一种针对基于 Vision Transformer 模型的创新隐私保护目标检测方法,该方法利用感知加密和带有密钥的领域自适应技术来保护敏感视觉信息,同时保持与未受保护模型相当的准确度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代世界中,计算机已经学会了如何“看”。它们可以扫描一张照片并瞬间识别出狗、汽车或人,这种能力为从自动驾驶汽车到安防系统的各种应用提供了动力。这种能力依赖于一种被称为“视觉 Transformer”(Vision Transformer)的人工智能类型,它将图像分解成小块,并分析这些小块如何组合在一起以理解整个场景。然而,这种力量也带来了风险。为了使用这些系统,人们通常不得不将私密照片发送到云端的远程服务器。如果该服务器遭到破坏,或者运行它的管理人员不可信,敏感的视觉信息就可能泄露。科学家面临的挑战是:如何让计算机在不向除所有者之外的任何人展示实际图像的情况下,实现足够的“视觉”能力以完成其工作。
东京都市大学的一个研究小组通过创造一种在进行目标检测分析时保护图像的新方法,解决了这一问题。他们的工作专注于一种特别擅长识别图像中物体的特定人工智能模型。他们并没有尝试用复杂的、会干扰计算机的缓慢加密技术来隐藏图像,而是设计了一个涉及计算机处理图像方式的巧妙技巧。他们利用一个秘密密钥对原始照片的视觉细节进行打乱,使其在人类眼中变成一团混乱、无法辨认的杂乱信息。与此同时,他们对计算机自身的内部指令应用了一个匹配的打乱处理。当这两个打乱的版本相遇时,计算机仍能高精度地执行任务,但持有数据的服务器看到的只是噪声。
研究人员使用了一种名为 ViTdet 的强大模型测试了这个想法,该模型旨在发现并定位图像中的物体。在标准设置下,如果你将一张打乱后的图像发送给一个未针对其进行调整的计算机,系统会完全失效。在实验中,当研究人员对照片进行加密但保持计算机模型不变时,系统的目标检测能力几乎降至零。计算机根本无法理解这些打乱的数据。这证明了仅仅隐藏图像是不够的;用于读取图像的工具也必须进行相应的改变。
为了解决这个问题,该团队创建了一个系统,在模型被发送到云端之前,模型本身就已经被加密了。他们生成了一个随机模式(类似于一种独特的洗牌代码),并利用它重新排列计算机理解图像微小部分的方式。随后,他们在将照片发送进行分析之前,对照片应用了完全相同的打乱模式。由于这种打乱是以特定的数学方式进行的,这两个打乱的元素在计算机的“大脑”内部相互抵消。计算机处理数据的方式就像是在观察原始、清晰的照片一样,尽管它从未真正见过清晰的照片。
他们的测试结果令人瞩目。当他们在包含 80 个不同物体类别的海量图像集上使用这种双重加密方法时,系统的表现几乎与未使用加密时一样出色。在一项使用标准数据集的测试中,该系统正确识别物体的准确度得分为 50.118,这非常接近使用未加密图像时取得的 51.412 分。即使在针对超过一千个物体类别的更大、更复杂的集合进行测试时,性能依然保持在高水平,加密方法的得分仅略低于未加密的基准线。至关重要的是,运行分析的服务器既没有看到原始图像,也不持有解开打乱状态所需的秘密密钥。
这种方法在隐私保护方面迈出了重要的一步。它证明了在不牺牲准确性或安全性方面,将敏感的视觉任务外包给云端是可行的。研究人员发现,该方法在处理从微小细节到宏大场景的不同尺寸物体时都非常有效,并且即使在图像被压缩或缩放时也能保持稳健。通过确保计算机的内部逻辑和输入数据都通过一个秘密密钥紧密锁定在一起,他们创建了一个让云端可以进行“思考”,却永远不知道其“思考内容”的系统。这意味着在未来,用户可以放心地将私密照片分享出去进行分析,因为视觉内容始终受到保护,由只有用户及其特定模型才能解锁的数学盾牌所守护。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。