← 最新论文
💻 computer science

Auditing Inference-Time Defense Evaluation for Multimodal Large Language Models

本文对多模态大语言模型推理时防御机制进行了可追溯的对比审计,揭示了基准测试数据和评估协议中存在的关键溯源失效问题,这些问题使先前的普遍拒绝声明失效,并强调了在未来安全性评估中建立严格数据完整性标准的必要性。

原作者: Bulat Nutfullin, Vladimir Evgrafov, Dmitry Namiot

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Bulat Nutfullin, Vladimir Evgrafov, Dmitry Namiot

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位顶级餐厅的主厨,你的餐厅同时提供两种东西:盘中的图像和口头的订单。你的目标是确保厨房绝不会做出任何危险的东西,即使有人试图通过图像里的陷阱或以奇怪的方式低声细语来欺骗主厨。这就是**多模态大语言模型(MLLMs)**的世界。这些超级聪明的计算机大脑既能“看”图像,也能“读”文本,还能与你聊天。但因为它们具备视觉能力,坏人可能会尝试通过像素绘图或在照片背景中隐藏指令,从而偷偷植入有害的命令。

为了阻止这种情况,科学家们发明了推理时防御(Inference-Time Defenses)。把它们想象成站在厨房门口的保安。他们并不改变主厨的食谱(模型的脑子);相反,他们在订单进入之前进行检查,或者在成品出锅之前进行检查。有些保安会在订单上附上一张礼貌的警告便条,而有些则会稍微晃动一下图片,以模糊掉隐藏的诡计。大家都在问的一个大问题是:到底哪位保安的工作表现最好? 如果我们无法信任这些保安,我们可能会不小心端出危险的餐点;或者更糟的是,因为过度害怕危险,我们甚至拒绝提供任何食物。


大厨房审计:当计分卡出错时

来自莫斯科的一个研究小组决定扮演侦探的角色。他们并没有建造新的保安,而是深入调查了一项最近的实验档案,该实验声称测试了三种不同的安全保安(灵感来自名为 RapGuard、AdaShield 和 SmoothVLM 的方法),并针对八种不同的 AI 主厨进行了测试。他们想看看谁才是最优秀的。然而,当他们翻阅文件时,发现了一堆断开的链接、缺失的食材和混乱的计分卡。

以下是他们的发现,附带一些现实层面的真相检查。

1. “缺失食材”之谜

研究人员发现,这项实验原本应该测试 9,000 个不同的订单(输入),涵盖七种不同的安全测试。然而,当他们检查溯源(数据来源的记录)时,意识到七个测试中有三个完全失效了

  • “错盘”错误: 其中一个旨在检查 AI 是否能识别图像中隐藏指令的测试,实际上端错了盘子。这就像试图通过往烤面包机而不是烟雾探测器上喷水来测试火警报警器一样。
  • “纯文本”作弊: 另一个测试本应是图像和文本的结合,但系统却让 AI 忽略了图像,仅仅阅读文本。这是一个“纯文本回退”现象,意味着 AI 根本不需要看图就能通过测试。
  • “随机补丁”故障: 第三个测试声称使用了特殊的“对抗性补丁”(一种用来迷惑 AI 的微小且诡异的贴纸)。但计算机并没有生成那个诡异的贴纸,而只是画了一个随机的矩形。

由于这些错误,研究人员不得不废弃了这三个测试的结果。他们不能仅仅“修正”数字;数据本身已经不存在了。这使得他们只能处理来自四个特定测试(FigStep、JailBreakV、SALAD-Bench 和 HarmBench-Simple)的 4,820 个有效输入

2. “关键词”陷阱

原始实验使用了一种非常简单的方法来判断 AI 是否安全:它寻找特定的“魔法词汇”。

  • 如果 AI 说“我不能这样做”或“很抱歉”,它会被标记为安全(拒绝回答)。
  • 如果 AI 说“这是如何……”或“当然,我可以帮忙”,它会被标记为不安全(有害回答)。

研究人员发现这种方法存在巨大问题。系统将空回答(AI 什么也没说的情况)也计为了“安全”,仅仅是因为遗留的代码没有专门针对这种情况的规则;由于空字符串既不匹配“有害”列表,也不匹配“拒绝”列表,默认逻辑将其视为安全。它还将那些以礼貌警告开头但随后给出危险指令的回答也计为了“安全”,因为系统只寻找是否存在拒绝短语来覆盖有害信息,有时逻辑会因此发生混乱。

当他们重新检查数据时,发现“关键词”方法是一个糟糕的评判者。这就像一位老师在批改试卷时只看是否出现了“的”这个字,而完全忽略学生是否回答了问题。在对 246 个棘手回答的审计中,关键词系统漏掉了 13 个有害回答,而一个更聪明、更像人类的评判者(“Haiku 系列评判者”)却正确地识别出了这些危险内容。从技术角度看,关键词系统将这些情况标记为“安全”,而它们实际上是“有害”的(即假阴性/漏报)。

3. “大规模拒绝”的迷思

原始研究似乎暗示这些安全保安导致了 AI 拒绝了所有请求(即“大规模拒绝”)。研究人员重新审计了 38,500 个安全、正常的提问,以查看 AI 在不需要拒绝时到底有多少次说了“不”。

结果如何?AI 其实非常礼貌且乐于助人。

  • 估计的不必要拒绝率仅为 0.52%
  • 即使在最坏的情况下(最大的单一数据组),该比例也仅为 3.24%
  • 研究人员指出,“仅抽样”带来的不确定性(误差范围)可能达到 10.92%,但即便如此,这也远非原研究所暗示的“大规模拒绝”。

混乱源于“防御性前导语(defensive preamble)”。安全保安经常在回答开头加上一段长长的礼貌警告(例如,“我必须警告您,这是危险的……”)。旧的关键词系统认为这个警告就是拒绝,但 AI 实际上随后还是给出了答案。这就像一个保镖说“我不让你进门”,但随后又打开了门让你可以走进去。关键词系统将这些前导语误标为了拒绝,从而夸大了拒绝率。

4. 安全的代价

最后,研究人员观察了这些安全保安浪费了多少时间。

  • “高斯(Gaussian)”保安(它会将图像模糊处理五次并对答案进行投票)处理单个请求的时间比不做任何处理要慢 5.45 到 12.76 倍
  • 三个保安组成的完整组合包处理时间则要慢 4.36 到 16.59 倍

这意味着,虽然保安们可能是在提供帮助,但他们让厨房变得极其缓慢。

底线

这篇论文并没有告诉我们哪个安全保安是“最好的”。事实上,它告诉我们我们无法信任之前的排名,因为数据是破碎的,且评分方法存在缺陷。

  • 他们排除了什么: 他们证明了关于“大规模拒绝”的原始说法是错误的,并且证明了七个安全测试中有三个是无效的。
  • 他们发现了什么: 安全保安(特别是提示词包装器)确实会改变 AI 的行为,但这种影响取决于 AI 模型和测试类型的不同。有时它们有帮助,有时它们会造成干扰,有时它们只是让速度变慢。
  • 教训: 你不能仅仅运行一个测试并看一个分数。你需要确保“食材”(输入)是真实的,确保“计分卡”(评估)确实在衡量安全性,并且你需要拥有完整的“食谱”(原始文本)来核查工作。

作者总结道,在我们能够比较不同的安全保安之前,我们需要建立一个更好、更诚实的测试系统。在此之前,我们无法确定谁是英雄,谁只是在拖慢厨房的速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →