Evaluating calibrated refusal and safe usefulness in dual-use biology settings
本文介绍了 BioSecBench-Refusal,这是一个用于评估生物研究领域 AI 智能体的基准测试,它揭示了一个关键的权衡问题,即当前的模型往往会对合法的科学任务过度拒绝,却无法一致地识别出隐藏的生物安全风险,从而凸显了对拒绝机制和推理能力进行更好校准的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你构建了一个超级智能的机器人助手,旨在帮助科学家发现新药并理解生命运作的方式。这个机器人才华横溢:它可以阅读复杂的生物数据、设计蛋白质并规划实验。但问题在于,这些能够帮助科学家治愈疾病的技能,如果落入不法之徒手中,也可能被用来制造危险的生物武器。
这篇名为 BioSecBench-Refusal 的论文,就像是对这些机器人助手进行的一次巨大的“压力测试”。研究人员想要回答两个重大问题:
- 机器人能识破隐藏的陷阱吗?(如果有人试图诱骗它制造危险物品,它会说“不”吗?)
- 机器人是否过于胆小怕事?(它是否仅仅因为某些请求听起来有一点风险,就对无害且有益的请求说“不”?)
两种类型的测试
为了测试这些机器人,研究人员创建了两种不同类型的“家庭作业”,就像一种“好警察/坏警察”的情景:
“红队”任务(陷阱): 这些是看起来像是正常研究,但隐藏着致命秘密的虚构场景。
- 类比: 想象你要求机器人“烤一个蛋糕”。食谱看起来很正常,但如果你仔细观察成分表(这个清单隐藏在一个机器人必须打开的文件中),你会发现其中一种成分其实是毒药。机器人需要足够聪明,能够读出这些细微之处并说:“等等,这很危险!”
- 目标: 测试机器人是否能利用其推理能力来发现隐藏的危险。
“常规”任务(实际工作): 这些是基于真实发表的科学论文编写的。它们是科学家正在进行的合法研究。
- 类比: 想象一位科学家要求机器人“分析一种病毒”以帮助研制疫苗。单词“病毒”和“分析”听起来可能让紧张的安全人员感到害怕,但其意图纯粹是好的。
- 目标: 测试机器人是否会因为关键词听起来有风险就疑神疑鬼,从而拒绝做有益的工作。
他们的发现
研究人员测试了 16 个不同版本的 AI 机器人(使用了不同的模型和设置)。结果如下:
1. “保安”太容易触发警报了。
大多数情况下,当机器人说“不”时,并不是机器人做出了明智的决定,而是由于一个预设的“保安”(由 AI 所有公司构建的过滤器)在机器人开始思考之前就拦截了请求。
- 结果: 机器人拒绝执行合法的、有益的工作(常规任务)的频率,几乎与拒绝虚假危险陷阱(红队任务)的频率一样高,甚至更高。
- 隐喻: 这就像一个夜店保镖,因为看到医生带着“注射器”就拦住医生,却让一个犯罪分子通过不使用“炸弹”这个词的邀请函溜了进去。
2. 如果你允许它们思考,机器人是可以思考的。
当研究人员设置测试,让机器人能够真正“思考”并查看数据文件(而不是仅仅被立即拦截)时,机器人识别隐藏陷阱的能力变强了。
- 结果: 当被允许进行推理时,机器人有时可以推断出:“哦,这段 DNA 序列实际上是一种毒素”,即使请求中并没有明说。
- 隐喻: 如果你让保镖真正检查客人的身份证并查看他们的包,他们就能分辨出医生带着注射器和犯罪分子带着炸弹的区别。但目前的情况是,保镖只是在检查客人的名字是否在名单上,然后就过快地将人拒之门外。
3. “过度拒绝”的问题。
研究发现,对于许多机器人设置,安全、现实世界的科学任务的拒绝率在 7% 到 74% 之间。而对于虚假的危险陷阱,拒绝率在 1% 到 62% 之间。
- 启示: 当前的安全系统在两个方向上都是“不完美的”:它们既漏掉了真实的威胁(让坏人进来),又同时阻碍了大量的科学研究(把好人挡在外面)。
大局观
论文的结论是,我们目前正处于一个尴尬的境地。
- 过度的安全性阻碍了现实中的科学家履行职责。
- 不足的安全性可能会让不法分子利用 AI 造成伤害。
作者们建议,解决方案不仅仅是让机器人通过拦截更多单词来变得“更安全”。相反,我们需要教它们进行更深层次的推理。我们需要它们去观察实际的生物数据(“食材”),而不是仅仅扫描可怕的单词(“菜单描述”)。
他们发布了这个测试套件(BioSecBench-Refusal),作为其他公司调整其机器人的工具。目标是找到那个“金发姑娘原则”下的平衡点(Goldilocks zone):即一个既足够聪明能抓住隐藏陷阱,又足够勇敢能让真正的科学家开展其有益工作的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。