← 最新论文
🤖 machine learning

GeoDetect: Geometric Adversarial Detection for VLPs

本文介绍了 GeoDetect,这是一种针对视觉-语言预训练模型(VLPs)的几何对抗检测方法,它利用对抗样本在各向异性嵌入空间中增加的离流形距离,从而在多种架构和威胁场景下可靠地识别攻击。

原作者: Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, James Bailey, Sarah Erfani

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, James Bailey, Sarah Erfani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机不仅能看图或读字,还能理解它们如何翩翩起舞的世界。这就是**视觉-语言预训练模型(Vision-Language Pre-trained Models, VLPs)**的领域。把它们想象成超级聪明的图书管理员,他们读过宇宙中每一本书,看过每一幅画,学会了如何将一段关于日落的描述与一张日落的照片完美匹配。它们是许多酷炫技术背后的引擎,比如通过文本寻找图像、回答关于照片的问题,甚至是在没有被告知要寻找什么的情况下描述一个场景。但是,像任何强大的工具一样,它们也有一个弱点:对抗性攻击(adversarial attacks)。这些攻击就像是添加到图像或句子中的微小的、几乎看不见的“故障”或“诡计”,会让计算机产生混乱,让它把熊猫看成长臂猿,或者把停止标志看成限速标志。虽然我们已经知道如何在单模态系统(例如仅处理照片)中识别这些诡计,但对于当计算机同时处理图像和文字时如何捕捉这些诡计,我们还没有真正搞清楚。这非常重要,因为如果这些模型被用于安全至关重要的工作,我们需要在它们犯下危险错误之前知道自己是否正在被欺骗。

于是,由墨尔本大学和蒙纳士大学的 Afsaneh Hasanebrahimi 及其团队提出的新方法 GeoDetect 应运而生。他们决定通过调查计算机“大脑”的“形状”来观察是否能发现这些诡计。他们发现,这些模型存储信息的方式有点像一个拥挤的房间,人们并不是均匀地分布在一个开阔的田野里,而是站在一条非常特定且狭窄的走廊中。他们称之为各向异性(anisotropy)——这是一个高级词汇,意思是数据在某些方向上被拉伸,而在其他方向上被挤压。

该团队的大胆想法是,当有人试图用对抗性攻击来欺骗模型时,模型的内部“地图”会被推离那条拥挤的走廊,进入那些没有任何正常数据存在的空旷、怪异的空间。这就像是在一个舞厅里,每个人都在中心区域跳着特定的舞步,而一个恶作剧者试图溜进来做一个古怪、僵硬的动作;他们最终会站在远离人群的空旷空间里,靠近墙壁的地方。GeoDetect 就像是一个保安,测量一个新人与人群之间的距离。如果这个新人站在太远的空旷空间里(偏离了“流形”,即数据的自然形状),保安就知道出问题了。

为了实现这一点,GeoDetect 使用了一套几何测量工具箱。它检查诸如**局部内在维度(Local Intrinsic Dimensionality, LID)**之类的指标,这就像是在问:“描述这个点需要多少个方向?”它还使用 k-最近邻算法(k-NN) 来查看一个点离它的朋友有多近,使用 马氏距离(Mahalanobis distance) 来衡量一个点相对于人群平均形状看起来有多奇怪,以及使用 核密度估计(Kernel Density Estimation, KDE) 来观察一个点周围的拥挤程度。通过结合这些测量手段,该系统可以分辨出一个输入是正常的、干净的样本,还是一个狡猾的对抗性样本。

研究人员在包括 CLIP 和 ALBEF 在内的各种流行模型上测试了这个想法。他们发现,他们的理论是成立的:对抗性样本确实会落在那些“流形之外”的区域,比正常数据离得更远。在实验中,GeoDetect 能够识别出跨越不同类型模型和不同类型诡计(包括仅破坏图像、仅破坏文本或两者同时破坏的攻击)的攻击。最棒的部分是?它不需要重新训练模型或学习新知识;它只是观察数据本身的几何形状。这表明,通过简单地理解数据空间的形状,我们可以构建一个稳健且轻量级的护盾,保护这些强大的 AI 模型不被愚弄。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →