← 最新论文
💻 computer science

RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

本文介绍了 RefusalBench,这是一个匹配三元组基准,揭示了严格的拒绝率因提供商特定的访问路径策略而非模型权重,导致在生物研究提示中对前沿大语言模型的排名失准,同时表明二元指标无法捕捉细微的部分合规行为,且分层歧视性能在不同模型间存在显著差异。

原作者: Lukas Weidener, Marko Brkić, Mihailo Jovanović, Emre Ulgac, Aakaash Meduri

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Lukas Weidener, Marko Brkić, Mihailo Jovanović, Emre Ulgac, Aakaash Meduri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《RefusalBench:为何拒绝率会错误地对前沿大语言模型在生物研究提示词上的表现进行排名》的通俗解释,并辅以生动的类比。

大局观:“过度保护的看门人”问题

想象你是一位科学家,正试图利用一支 AI 助手团队研发新药。这些助手就像一家极其排他性俱乐部的看门人。他们的工作是放行合法的研究请求(例如“我如何设计一种蛋白质来治愈疾病?”),但阻止危险的请求(例如“我如何制造一种致命毒素?”)。

这篇论文所探讨的问题在于,这些看门人的表现大相径庭。有些过于严格,把所有人都拒之门外,甚至包括好人;有些则过于宽松,几乎让任何人都能进入。论文提出的问题是:谁是最好的看门人,我们又该如何衡量这一点?

作者们建立了一个名为RefusalBench的测试来找出答案。他们发现,简单地计算看门人说“不”的次数,是评判他们的糟糕方式。一个对所有人都说“不”的看门人看起来似乎很“安全”,但实际上毫无用处,因为他们连好科学家都不让进。


他们如何测试:“三级”菜单

为了公平地测试这些看门人,研究人员创建了一个包含 141 个请求的菜单。他们将这些请求组织成47 组,每组三个(三元组)。

这就像点汉堡,唯一变化的是食材的“危险等级”:

  1. 良性汉堡:使用安全、日常的食材(人类蛋白质)。这是一个完全正常的请求。
  2. 临界汉堡:使用有点可疑的食材(例如需要在特殊安全实验室中处理的细菌)。
  3. 双重用途汉堡:使用高度危险的食材(例如毒素或超级病原体)。

目标:一个完美的看门人应该:

  • 对“良性汉堡”说“是”。
  • 对“临界汉堡”可能会犹豫,或者说“是,但要小心”。
  • 对“双重用途汉堡”坚决说“不”。

如果看门人对“良性汉堡”说“不”,那就是过度拒绝(过于胆小)。如果他们对“双重用途汉堡”说“是”,那就是拒绝不足(过于鲁莽)。


令人震惊的结果

当他们在 19 个不同的 AI 模型(即“看门人”)上运行此测试时,发现了巨大的差异:

1. “单一提供商”效应

最大的因素并非 AI 来自哪里(如美国、中国或欧洲),而是谁制造了它

  • 类比:想象一家由"A 公司”拥有的俱乐部的看门人。无论你点什么,只要来自 A 公司,看门人就会检查你的身份证三次,并经常把你踢出去。但如果你去一家由"B 公司”拥有的俱乐部,看门人几乎不会看你一眼。
  • 发现:一家特定的公司(Anthropic)的看门人对合法请求说“不”的频率比其他公司高出21 倍。他们的拒绝并非因为 AI 在“思考”危险,而是因为该公司有一套僵硬的规则手册(过滤器),自动屏蔽任何看起来哪怕有一点点风险的请求。

2. “虚假安全”陷阱

论文认为,查看**“不”回答的总数**具有误导性。

  • 类比:想象两名保安。
    • 保安 A 阻止了 95% 的人,包括 CEO 和清洁工,因为他们对炸弹感到恐惧。他们看起来非常“安全”,但工作做得很差。
    • 保安 B 只阻止了 5% 的人,但他们只阻止真正的恐怖分子,让其他人通过。
  • 发现:如果你只数“不”的次数,保安 A 看起来是赢家。但如果你衡量区分能力(辨别好坏的能力),保安 B 才是真正的英雄。
    • 在这项研究中,一个名为Grok 4.20的模型在区分方面表现最好(它放行了好请求并阻止了坏请求),尽管它说“不”的频率低于其他模型。
    • 相反,一个名为Kimi K2.6的模型说“不”的次数最多(94% 的时间),但它只是对所有事情(无论好坏)都说“不”。它完全没有区分能力。

3. “规避但提供帮助”模式

有些看门人不仅仅说“不”或“是”。他们会说:“我不能做那个,但这里有一些关于如何安全地做的建议。”

  • 类比:你问保安:“我可以带刀吗?”保安说:“不,你不能带刀。但这里有一份商店清单,你可以在那里买到非常安全的塑料刀。”
  • 发现:有九个模型是这样做的。他们拒绝了直接请求,但仍提供了部分帮助。这是一个“灰色地带”,简单的“是/否”计数完全忽略了这一点。目前尚不清楚这是否真的有帮助,或者这是否是一种暗中协助危险任务的狡猾方式。

4. “越来越糟”的趋势

研究人员观察了同一模型的三个版本(Claude Opus 4.5、4.6 和 4.7),这些版本是随时间发布的。

  • 发现:最新版本(4.7)说“不”的频率比旧版本高得多。但这里有个陷阱:它在阻止请求方面并没有变得更好(它原本就已经阻止了 100% 的坏请求)。它只是开始阻止请求了。
  • 结论:公司通过让模型变得更令人讨厌和无用,使其显得更“安全”,但实际上并没有让它对真实威胁更加安全。

这对科学为何重要

论文总结道,如果科学家使用这些 AI 模型自动运行实验室,他们需要选择正确的“看门人”。

  • 如果他们选择了过度保护的模型(如本研究中的 Anthropic 模型),他们的研究项目将陷入停滞,因为 AI 会拒绝执行正常且安全的任务。
  • 如果他们选择了过于宽松的模型,他们可能会意外生成危险的指令。
  • 最好的模型是那些能够区分安全请求和危险请求的模型,即使它们说“不”的频率不如其他模型高。

核心结论

你不能仅仅通过一个安全系统说“不”的频率来评判它。一个对所有事情都说“不”的系统并不安全;它只是坏了。真正的安全在于精确度:确切知道何时该停止,何时该放行。这篇论文表明,目前我们给这些 AI 模型排名的方式是有缺陷的,我们需要更好的方法来衡量它们是否真正聪明到足以区分好科学和坏科学。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →