Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer
本文介绍了 MVAP-G,这是一个新颖的框架,它通过单次前馈传递生成一致的多视图对抗性扰动,从而在无需昂贵的逐场景优化的情况下,有效地破坏视觉几何落地 Transformer (VGGT)。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,新一代计算机视觉系统已经出现,它们能够从平面照片中理解三维世界。这些被称为“基础模型”的系统充当了视觉数据的通用翻译器。它们不仅仅是识别图像中包含汽车或树木,还能通过整合从不同角度拍摄的多张图片,构建出一个完整的、可导航的三维场景模型。这项技术有望彻底改变机器人的导航方式、自动驾驶汽车感知周围环境的方式,以及我们与数字环境交互的方式。然而,正如物理结构存在必须由工程师加固的薄弱环节一样,这些数字系统也存在隐藏的漏洞。研究人员早已知晓,通过在图像中添加微量且不可见的噪声,可以误导计算机去看到并不存在的东西。这就是对抗性攻击(adversarial attacks)的领域,其目标是寻找能够引起机器理解发生大规模失效的最微小的变化。
挑战一直在于速度和一致性。创建这些欺骗性图像的传统方法需要计算机针对每个特定场景花费大量时间进行分析,计算出针对该单一时刻的完美噪声模式。对于场景瞬息万变的现实应用场景来说,这个过程太慢了。其他方法则使用一种单一的、静态的噪声模式应用于每一张图像,期望它能随处奏效,但面对复杂的3D系统时,这些方法往往会失败,因为它们无法适应场景不断变化的几何结构。香港浸会大学的一个研究小组现在开发了一种新方法,同时解决了这两个问题。他们创建了一个系统,可以在瞬间生成跨越场景多个视角的、一致且不可见的攻击,而无需针对每个新情况进行停顿和计算。
研究人员将工作重点放在了一个名为“视觉几何接地Transformer”(Visual Geometry Grounded Transformer)的高性能特定模型上。该模型旨在接收一系列图像并立即重建一个3D点云——这本质上是一个由数百万个点组成的数字骨架,代表了空间中物体的形状和位置。团队发现,虽然该模型在正常条件下极其快速且准确,但在面对特定类型的协同欺骗时却显得异常脆弱。他们构建了一个工具,将其命名为“多视图对抗扰动生成器”,该工具的作用就像一个快速连拍的相机滤镜。它不是先分析场景再缓慢构思诡计,而是学习模型弱点的模式,并同时对序列中的每一张图像应用定制化的畸变。
为了实现这一点,系统必须学会一种艰难的平衡。它需要创造出既足够强大到能粉碎3D重建,又足够细微以至于人类肉眼永远无法察觉的噪声。研究人员设计了一种机制,强制噪声在所有不同的摄像视角下保持一致。如果噪声在不同角度之间看起来不一致,3D模型可能会将其视为误差并进行自我修正。通过确保畸变在所有视图中完美对齐,该系统可以迷惑模型的内部逻辑,导致其丧失对场景几何结构的掌控。其结果是3D结构的彻底崩溃,重建的世界会消散成一片混乱的碎片,或者完全消失,而输入图像对人类观察者而言看起来依然完美无瑕。
实验表明,这种新方法比以往的尝试要优越得多。在针对试图破解这些系统的标准模型进行测试时,新生成的生成器仅需一步即可达成目标,而旧方法则需要数十次缓慢且重复的计算才能达到类似效果。在涉及多达25个不同摄像视角的场景测试中,新系统持续降低了3D重建的质量,导致数字点云发生散射或缩减至无。研究人员发现,这种攻击不仅针对3D形状本身,还针对模型估计深度和相机位置的能力,而这些对于导航至关重要。该系统可以在毫秒内将一个清晰、详细的房间地图变成一个破碎、无法使用的点云。
这一发现最引人注目的方面之一是攻击的高效性。研究人员展示了他们的工具可以在不到一秒的时间内处理包含多个视角的复杂场景,且使用的计算机内存远低于传统方法。这种速度意味着此类攻击理论上可以部署在实时场景中,例如行驶在街道上的机器人或在城市中飞行的无人机。研究指出,单一的、静态的噪声模式无法对抗这些复杂的3D模型,而是必须是动态的,并且能够感知不同摄像视角之间的关系才能生效。团队还确认,这种攻击并不依赖于大型、明显的畸变;其变化极其微小,以至于对人眼是不可见的,在完全破坏机器理解空间能力的同时,保留了原始照片的纹理和外观。
这项工作的意义超出了实验室范围。研究人员强调,他们的发现凸显了部署3D视觉系统时存在的关键安全缺口。如果一个模型可以如此轻易且快速地被误导,那么依赖这些模型的应用(如自动驾驶汽车或机器人导航)的安全性就可能受到威胁。该研究并非声称这些系统已彻底损坏,而是指出它们目前正面临一种尚未得到充分解决的、特定且高效的欺骗类型。作者总结道,紧迫的下一步是开发鲁棒的防御和检测机制来保护这些系统。他们认为,如果没有这些防护措施,3D基础模型的快速普及可能会使关键基础设施暴露在新的危险风险之下,即一个微妙且不可见的信号就能导致机器在现实世界中迷失方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。