← 最新论文
🤖 machine learning

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

本文提出了一种输出感知型安全护栏,该护栏通过预测模型隐藏状态空间内的潜在不安全生成,来缓解输入侧过滤器常见的过度拒绝问题,从而在多模态大语言模型中同时兼顾安全性与实用性。

原作者: Jiayi Li, Kun Zhan

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiayi Li, Kun Zhan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它能看图说话。这个机器人非常擅长回答问题,但有时人们会试图诱骗它说出不友善的话、给出危险的指令或传播谎言。为了阻止这种情况,我们通常会在机器人前面放一个“保安”。

问题:过度保护的保镖
目前,大多数保安的工作方式就像一个严格的夜店保镖,只看你的身份证(你提出的问题)就把你拦在门外。如果你的身份证上有一个可怕的词,保镖就会立刻关上门,即使你只是想问一个无害的问题。

例如,如果你问:“如何杀死(kill)一个 Python 进程?”(这只是关于计算机代码的),保镖看到了“杀死”这个词,就把你拦住了。如果你问:“在哪里可以拍(shoot)一张好照片?”(这是关于摄影的),保vez 看到“拍摄/射击”这个词就说:“没门!”机器人甚至没有机会解释你其实是在进行安全且有益的交流。这种现象被称为过度拒绝(over-refusal)。这就像那个保安因为太害怕麻烦,结果不小心把所有好顾客都赶走了。

旧方法 vs. 新方法
研究人员发现,这些旧的保安完全根据输入(你问了什么)来做决定。他们不会等待看机器人实际了什么。

这篇论文反对这种“仅基于输入”的方法。它认为机器人本身其实很擅长保持安全。如果你问一个带有陷阱的问题,机器人通常知道自己应该给出警告或说“我不能这样做”。但旧的保安在机器人展示其优秀的一面之前就把机器人拦住了!

解决方案:OutGuard(“水晶球”式保安)
作者提出了一个名为 OutGuard 的新系统。OutGuard 不仅仅是看你的身份证,它更像是一个水晶球,在机器人思考的过程中、但在它开口说话之前,窥视机器人的大脑。

它是这样工作的:

  1. 窥视(The Peek): 当机器人开始构思答案时,OutGuard 会观察在机器人大脑层中旋转的“隐藏想法”(称为隐藏状态)。
  2. 预测(The Prediction): 它会尝试猜测:“机器人是准备说一些真正危险的话,还是仅仅在思考一个危险话题但计划说一些安全的内容?”
  3. 决策(The Decision):
    • 如果机器人即将说出真正有害的内容(比如如何制造炸弹),OutGuard 会介入并阻止它。
    • 如果机器人即将说出安全的内容(比如解释“杀死进程”只是编程术语),OutGuard 则会让它通过!

魔术技巧:从“袋子”中的想法中学习
为了教会 OutGuard 如何做到这一点,研究人员使用了一种聪明的训练方法,叫做多实例对比学习(Multi-Instance Contrastive Learning, MICL)

把机器人的答案想象成一袋弹珠。有些弹珠是危险的(坏词),而大多数是安全的。旧的保安只是看着这个袋子并说:“里面有一个危险的弹珠,把它扔掉!”
OutGuard 则会看向袋子内部。它使用一种特殊的注意力机制来寻找那些特定的危险弹珠。它学会了忽略那些安全的弹珠,只关注那些真正让整个答案变得有害的弹珠。这就像一个侦探,他知道发现一个坏苹果并不意味着整个篮子都烂了,除非那个坏苹果正是导致整篮果汁变质的原因。

数据说明
研究人员在两个流行的机器人模型 LLaVA 1.6Qwen 3.5 上测试了该系统。他们将 OutGuard 与其他顶尖保安(如 HiddenDetectorQGuardLoD)进行了对比。

  • 安全性(Safety): OutGuard 抓住了几乎所有真正的恶意请求。在标准测试集上,它在 LLaVA 上的 AUPRC 为 0.9725,在 Qwen 上为 0.9937(1.0 是完美值)。这意味着它在捕捉坏人方面与其他人一样出色。
  • 解决“过度拒绝”问题: 这是 OutGuard 脱颖而出的地方。旧的保安经常错误地拦截安全问题。
    • QGuard 拦截了 100% 的安全问题(ARSP = 1.0000)。它太胆小了,不敢让任何人进来。
    • OutGuard 在 LLaVA 上仅拦截了 5.5% 的安全问题,在 Qwen 上仅为 1.15%
    • 对于那些看起来危险但实际上是安全的棘手问题(例如“如何在机场消磨(kill)时间?”),OutGuard 比排名第二的方法多放行了 41.6% 的安全问题。

速度与成本
你可能会担心窥视机器人的大脑会降低速度。论文显示 OutGuard 非常快。平均每个问题仅需约 0.208 秒,这比一些需要 3 秒以上的其他方法快得多。它也不需要太多额外的内存,仅增加了约 1.37 GB

总结
这篇论文表明,通过从“输入感知”(检查问题)转向“输出感知”(在答案完成前检查答案),我们可以让机器人既保持安全又不那么烦人。OutGuard 不会阻止机器人提供帮助,它只是阻止机器人变得危险。这是一种更聪明、更精准的方式,在让我们能够提问的同时,也能维护互联网的安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →