← 最新论文
🤖 AI

EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models

EviSafe 引入了一个基于证据的框架和基准测试(EviSafeBench),该基准通过评估视觉语言模型不仅是最终响应,还包括模型将决策正确锚定在视觉/文本证据上的能力以及对反事实变化的适应能力,来评估视觉语言模型的安全性,从而揭示了当前模型往往无法出于正确的多模态原因而保持安全。

原作者: Xuetong Li, Gaofeng Liu

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuetong Li, Gaofeng Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界里,新一代计算机程序已经出现,它们能够同时进行视觉观察和文本阅读。这些被称为“视觉-语言模型”的系统,通过观察一张图像并阅读用户输入的文本,将这两股信息流结合起来,从而回答问题或提供建议。它们正越来越多地被用于解读医学影像、分析法律文件以及在复杂的社交场景中进行导航。由于这些工具可能会影响现实世界的决策,确保其安全性成为了一个至关重要的任务。多年来,研究人员通过向这些系统提出危险问题并检查计算机是否拒绝回答来测试它们。如果机器说“不”或给出警告,则被视为安全;如果它直接回答了问题,则被视为不安全。然而,这种方法仅仅关注最终结果,就像老师在批改学生作文时,只看结论而不阅读导致该结论的推理过程一样。计算机可能仅仅因为捕捉到了一个令人恐惧的关键词就拒绝请求,也可能因为忽略了图像中的关键细节而给出了危险的答案。问题在于:当一台机器表现得安全时,它真的是出于正确的原因而安全吗?

上海交通大学的一个研究小组开发了一种新的测试方法,这种方法比仅仅观察最终答案挖掘得更深。他们创建了一个名为 EviSafe 的框架,该框架不仅将安全性视为输出结果的“通过”或“失败”,而是将其视为寻找并使用正确证据的过程。想象一位在门口拦截人员的保安。简单的测试只询问保安是否拦截了那个人。而新的测试则会询问,保安拦截他是因为看到了武器,还是因为识别出了特定的威胁,亦或是仅仅因为那个人戴了一顶红帽子。研究人员构建了一个包含 1,181 个精心设计的场景的大规模集合,每个场景都包含一张图像和一个问题,并附带了一份关于计算机为做出正确决策应观察什么的详细地图。他们还创建了超过 2,400 个这些场景的变体,通过仅改变其中一小部分证据(例如移除照片中的危险物品或更改问题中的一个词)来观察计算机的行为是否会随之改变。

研究人员使用这种新方法测试了 11 种不同的视觉-语言模型。对于每个场景,他们向每个模型提出了三种类型的提问。首先,他们要求模型像用户一样自然地回答问题。其次,他们要求模型通过指出其做出决策所依据的具体文本和视觉线索来解释其推理过程。第三,他们向模型展示修改后的场景,以观察其在证据发生变化时能否调整其回答。结果显示,在“看起来安全”与“真正安全”之间存在显著差距。虽然一些模型在表面上表现尚可(自然安全性准确率约为 28% 至 53%),但它们正确识别并报告决策背后证据的能力却要低得多。事实上,只有极小比例的模型-场景记录(仅为 9.8%)被标记为“基于证据的成功”,这意味着模型既得到了正确的最终答案,又正确识别了证明该答案的特定视觉或文本证据。

研究发现,许多模型本质上是在猜测,或者在依赖捷径。计算机可能会因为看到了与危险相关的关键词而拒绝请求,即使图像显示的其实是无害的语境(例如医生正在解释一项医疗程序)。相反,一个模型可能会因为未能注意到图像中使请求变得不安全的某个关键细节而给出危险的答案。当研究人员改变测试场景中的证据时,许多模型未能调整其行为。例如,如果图像中的危险物品被移除了,一个真正安全的模型应该将回答从警告转变为安全的响应。然而,测试表明,只有约 30% 到 58% 的模型成功完成了这种切换。这表明这些系统并未可靠地理解图像与文本之间的关系。它们通常是在对表面模式做出反应,而不是建立起对情境的连贯理解。

研究人员还发现,模型的规模并不一定能解决这个问题。更大、更强大的模型在连接图像与文本之间的逻辑点方面,并不一定表现得更好。一些规模最大的模型虽然在被要求以结构化报告的形式解释风险因素时能正确识别,但在进行自然对话回答相同问题时,却仍无法安全地行动。这表明模型在分析证据的能力与利用该分析来引导其行为的能力之间存在脱节。研究结论指出,当前这一代的视觉-语言模型尚未实现“出于正确原因的安全”。它们可能只是偶然表现得安全,或者可能隐藏着通过简单拒绝测试无法察觉的不安全因素。为了构建真正可靠的系统,开发者需要超越“计算模型拒绝请求的频率”这一维度,开始训练它们将决策扎根于图像和文本中存在的实际证据之上,从而确保它们的安全性是基于理解而非偶然。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →