← 最新论文
💻 computer science

Evaluating calibrated refusal and safe usefulness in dual-use biology settings

本文介绍了 BioSecBench-Refusal,这是一个用于评估生物研究领域 AI 智能体的基准测试,它揭示了一个关键的权衡问题,即当前的模型往往会对合法的科学任务过度拒绝,却无法一致地识别出隐藏的生物安全风险,从而凸显了对拒绝机制和推理能力进行更好校准的必要性。

原作者: Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Daniel Fulop, Matthew C. Watson, Adam J. Meyer, Sandrine Boissel, Jens H. Kuhn, Rishi Jain, Noah
发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Daniel Fulop, Matthew C. Watson, Adam J. Meyer, Sandrine Boissel, Jens H. Kuhn, Rishi Jain, Noah D. Taylor, Helena Shomar, Patrick M. Boyle, Kenny Workman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你构建了一个超级智能的机器人助手,旨在帮助科学家发现新药并理解生命运作的方式。这个机器人才华横溢:它可以阅读复杂的生物数据、设计蛋白质并规划实验。但问题在于,这些能够帮助科学家治愈疾病的技能,如果落入不法之徒手中,也可能被用来制造危险的生物武器。

这篇名为 BioSecBench-Refusal 的论文,就像是对这些机器人助手进行的一次巨大的“压力测试”。研究人员想要回答两个重大问题:

  1. 机器人能识破隐藏的陷阱吗?(如果有人试图诱骗它制造危险物品,它会说“不”吗?)
  2. 机器人是否过于胆小怕事?(它是否仅仅因为某些请求听起来有一点风险,就对无害且有益的请求说“不”?)

两种类型的测试

为了测试这些机器人,研究人员创建了两种不同类型的“家庭作业”,就像一种“好警察/坏警察”的情景:

  • “红队”任务(陷阱): 这些是看起来像是正常研究,但隐藏着致命秘密的虚构场景。

    • 类比: 想象你要求机器人“烤一个蛋糕”。食谱看起来很正常,但如果你仔细观察成分表(这个清单隐藏在一个机器人必须打开的文件中),你会发现其中一种成分其实是毒药。机器人需要足够聪明,能够读出这些细微之处并说:“等等,这很危险!”
    • 目标: 测试机器人是否能利用其推理能力来发现隐藏的危险。
  • “常规”任务(实际工作): 这些是基于真实发表的科学论文编写的。它们是科学家正在进行的合法研究。

    • 类比: 想象一位科学家要求机器人“分析一种病毒”以帮助研制疫苗。单词“病毒”和“分析”听起来可能让紧张的安全人员感到害怕,但其意图纯粹是好的。
    • 目标: 测试机器人是否会因为关键词听起来有风险就疑神疑鬼,从而拒绝做有益的工作。

他们的发现

研究人员测试了 16 个不同版本的 AI 机器人(使用了不同的模型和设置)。结果如下:

1. “保安”太容易触发警报了。
大多数情况下,当机器人说“不”时,并不是机器人做出了明智的决定,而是由于一个预设的“保安”(由 AI 所有公司构建的过滤器)在机器人开始思考之前就拦截了请求。

  • 结果: 机器人拒绝执行合法的、有益的工作(常规任务)的频率,几乎与拒绝虚假危险陷阱(红队任务)的频率一样高,甚至更高。
  • 隐喻: 这就像一个夜店保镖,因为看到医生带着“注射器”就拦住医生,却让一个犯罪分子通过不使用“炸弹”这个词的邀请函溜了进去。

2. 如果你允许它们思考,机器人是可以思考的。
当研究人员设置测试,让机器人能够真正“思考”并查看数据文件(而不是仅仅被立即拦截)时,机器人识别隐藏陷阱的能力变强了。

  • 结果: 当被允许进行推理时,机器人有时可以推断出:“哦,这段 DNA 序列实际上是一种毒素”,即使请求中并没有明说。
  • 隐喻: 如果你让保镖真正检查客人的身份证并查看他们的包,他们就能分辨出医生带着注射器和犯罪分子带着炸弹的区别。但目前的情况是,保镖只是在检查客人的名字是否在名单上,然后就过快地将人拒之门外。

3. “过度拒绝”的问题。
研究发现,对于许多机器人设置,安全、现实世界的科学任务的拒绝率在 7% 到 74% 之间。而对于虚假的危险陷阱,拒绝率在 1% 到 62% 之间。

  • 启示: 当前的安全系统在两个方向上都是“不完美的”:它们既漏掉了真实的威胁(让坏人进来),又同时阻碍了大量的科学研究(把好人挡在外面)。

大局观

论文的结论是,我们目前正处于一个尴尬的境地。

  • 过度的安全性阻碍了现实中的科学家履行职责。
  • 不足的安全性可能会让不法分子利用 AI 造成伤害。

作者们建议,解决方案不仅仅是让机器人通过拦截更多单词来变得“更安全”。相反,我们需要教它们进行更深层次的推理。我们需要它们去观察实际的生物数据(“食材”),而不是仅仅扫描可怕的单词(“菜单描述”)。

他们发布了这个测试套件(BioSecBench-Refusal),作为其他公司调整其机器人的工具。目标是找到那个“金发姑娘原则”下的平衡点(Goldilocks zone):即一个既足够聪明能抓住隐藏陷阱,又足够勇敢能让真正的科学家开展其有益工作的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →