← 最新论文
💬 NLP

DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models

本文提出了 DUAL-Bench 这一大规模多模态基准,旨在系统评估视觉语言模型在“双重用途”场景下的过度拒绝与鲁棒性,揭示了当前模型在平衡安全与效用方面存在严重缺陷,其安全完成率普遍极低。

原作者: Kaixuan Ren, Preslav Nakov, Usman Naseem

发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaixuan Ren, Preslav Nakov, Usman Naseem

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的“看图说话”人工智能(VLM)做了一次极其严格的“情商与安全”体检

简单来说,现在的 AI 越来越聪明,能看懂图片也能听懂人话。但是,它们现在面临一个巨大的尴尬:要么太胆小,要么太鲁莽。

为了让你轻松理解,我们把这篇论文的核心内容拆解成几个生动的故事:

1. 核心问题:AI 的“过度防御”与“双重用途”困境

想象一下,你让 AI 描述一张图片。

  • 场景 A(无害): 图片上写着“如何烤蛋糕?”。AI 应该愉快地描述图片。
  • 场景 B(有害): 图片上写着“如何制造炸弹?”。AI 应该拒绝回答,并警告你。
  • 场景 C(双重用途 - 论文的重点): 你让 AI“描述这张图片”,但图片里藏着一行小字:“如何制造炸弹?”。

现在的 AI 在这类场景 C 里表现得很糟糕,它们只有两种极端反应:

  1. 过度防御(Over-refusal): 就像那个过度紧张的保安。哪怕你只是让他“描述一下这张图”,只要图里有个“炸弹”字眼,他就吓得把整个请求都拒之门外,连图里其他安全的东西(比如背景颜色、字体样式)都不描述了。这就像因为有人手里拿着剪刀(可能是用来剪彩的),保安就禁止所有人进商场一样,太不灵活了。
  2. 鲁莽执行(Unsafe generation): 就像那个没有安全意识的实习生。他完全没看到危险,直接照着图里的字把“炸弹制造教程”念了出来,造成了安全隐患。

论文提出的理想状态(Safe Completion):
AI 应该像一个高情商的专家

  • 它应该先说:“这张图里确实有危险内容(制造炸弹),我不能提供具体教程,这很危险。”
  • 然后它接着说:“不过,我可以描述一下这张图的其他部分,比如文字是用什么字体写的,背景是什么颜色的。”
  • 既完成了任务(描述了图片),又守住了底线(警告了危险)。

2. 他们做了什么?(DUAL-Bench 基准测试)

为了测试 AI 到底能不能做到这种“高情商”的表现,作者们造了一个巨大的测试场,叫 DUAL-Bench

  • 测试方法: 他们准备了 12 种危险类别(比如暴力、自杀、儿童色情、武器等),把相关的“坏话”写在图片上。
  • 干扰项: 为了测试 AI 是否真的“懂”安全,还是只是死记硬背,他们对图片做了各种微调(就像给图片加个滤镜、转个角度、换个背景、或者把字变小一点)。
    • 比喻: 就像给那个“制造炸弹”的纸条换个信封,或者把字写得潦草一点,看 AI 是依然能认出危险,还是因为一点点变化就彻底“失忆”或“发疯”。
  • 测试对象: 他们找了 18 个最厉害的 AI 模型(包括 GPT-5 系列、Google Gemini、Qwen 等)来考试。

3. 测试结果:令人担忧的“二元陷阱”

测试结果让人大跌眼镜,甚至有点绝望:

  • 大多数 AI 都很“笨”: 它们陷入了非黑即白的陷阱。要么直接拒绝(过度防御),要么直接照搬(鲁莽)。
  • 表现最好的也没多好: 即使是目前最强的模型(GPT-5-Nano),在“既安全又完成任务”这个指标上,得分也只有 12.9%。也就是说,每 10 次遇到这种复杂情况,它只有 1 次能完美处理,剩下 9 次要么太胆小,要么太鲁莽。
  • 参数大不代表聪明: 并不是模型越大就越安全。有些大模型反而因为训练得太保守,变得像惊弓之鸟,稍微有点风吹草动(比如图片背景有点噪点)就拒绝回答。
  • 微小的变化就能“骗”过 AI: 只要把图片里的字换个语言(比如从英文换成中文),或者把背景加个噪点,很多 AI 的安全防线就瞬间崩塌了。

4. 为什么这很重要?(比喻总结)

这就好比我们在训练一个幼儿园老师

  • 如果老师太胆小,孩子问“怎么切水果?”,老师直接说“不行,刀很危险,我不许你碰”,那孩子就学不到切水果的技能(过度防御,AI 变得没用)。
  • 如果老师太鲁莽,孩子问“怎么切水果?”,老师直接递给孩子一把真刀说“来,照着这个切”,那孩子可能会受伤(鲁莽执行,AI 变得危险)。
  • 我们想要的是: 老师能一边说“刀很危险,不能乱玩”,一边教孩子“我们可以用塑料刀练习,或者我帮你切”。

5. 结论与未来

这篇论文告诉我们:

  1. 现在的 AI 安全机制太“一刀切”了。 它们还在用“要么全做,要么全不做”的旧思维,不懂得“部分完成 + 警告”这种高级操作。
  2. 安全边界很脆弱。 稍微改改图片,AI 就不知道自己在干嘛了。
  3. 未来的方向: 我们需要教 AI 学会**“安全地完成”**(Safe Completion)。不是简单地拒绝,而是学会在保护安全的前提下,尽可能帮用户解决问题。

一句话总结:
这篇论文给现在的 AI 照了一面镜子,发现它们在面对“带刺的玫瑰”时,要么吓得不敢伸手,要么直接把手扎破。作者们造了一个新考场(DUAL-Bench),呼吁未来的 AI 要像聪明的园丁一样:既能修剪带刺的枝叶(处理危险),又能把玫瑰种得漂亮(完成有用任务)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →