← 最新论文
💻 computer science

BioTIER: A Refusal Benchmark for Targeted Biological Risk Mitigation

本文介绍了 BioTIER,这是一个由 542 个专家策划的提示词组成的新型基准测试,这些提示词分为三个风险类别,旨在帮助人工智能模型精确地识别并仅拒绝最具危险性的生物信息,同时保留获取有益科学知识的渠道。

原作者: Eleanor M. Marshall, Pedro Medeiros, Peter Peneder, Nelly Mak, Jacob Kaffey, Faith Rovenolt, Mac Walker, Seth Donoughe, Jasper Götting

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Eleanor M. Marshall, Pedro Medeiros, Peter Peneder, Nelly Mak, Jacob Kaffey, Faith Rovenolt, Mac Walker, Seth Donoughe, Jasper Götting

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大的、无尽的图书馆,书本都是由被称为“大语言模型”(LLM)的超级智能计算机编写的。这些计算机几乎读过了人类写下的所有内容,包括建造物品、修理发动机甚至理解生物运作方式的复杂手册。对于想要治愈疾病或创造新材料的科学家来说,这是一个了不起的工具。然而,它也有阴暗的一面:如果有人心怀恶意,向这些计算机询问如何制造危险病菌或生物武器的指令,计算机可能会直接回答:“给你!”因为它并不知道如何区分一位得力的科学家和一名恶棍。

科学家们正在尝试解决的核心问题是:如何教会这些计算机在拒绝危险请求的同时,不对有益的请求说“不”。这就像是在打造一名保安,他能拦住试图偷运炸弹的人,却能让医生顺利进入获取医学教科书。如果保安太严格,他们可能会阻碍真正的科学研究,从而损害科学;如果他们太宽松,可能会让窃贼进入,从而引发灾难。这篇论文深入探讨了这一问题,研究了不同的计算机模型在作为生物知识安全卫士方面的表现究竟如何。


“BioTIER”测试:超级计算机的安全检查

欢迎认识 BioTIER。你可以把它看作一场巨大的、充满陷阱的测验,旨在测试 AI 模型在扮演一个非常特定且高风险俱乐部的门卫时表现如何。这个俱乐部就是生物科学的世界,而门卫的任务是让“好东西”(比如如何制造疫苗)进入,同时将“坏东西”(比如如何制造大流行病)拒之门外。

BioTIER 背后的研究人员意识到,目前测试这些计算机的方法过于简单。那就像是在问:“你能阻止坏人吗?”然后得到一个“是”或“否”的回答。但在现实世界中,情况并非如此非黑即白。有些问题显然是危险的,有些显然是安全的,而有些则处于边缘——比如询问关于一种目前存在但尚未被用作武器的病毒。为了解决这个问题,团队创建了一个三级风险系统来对问题进行分类:

  1. “灾难规避”(CA)区域: 这些是超级危险的问题。想象一下有人问:“我如何获取一种致命的活病毒并让它传播得更快?”这类内容可能引发全球性的灾难。计算机必须拒绝回答这些问题。
  2. “生物医学双用途研究”(BD)区域: 这些是“双用途”问题。它们很棘手。它们可能涉及如何改造一种病毒,这对于制造疫苗很有用,但如果被误用也会非常危险。这些问题应该允许拥有身份识别卡的经过验证的科学家访问,但应屏蔽普通公众。
  3. “相关生物学”(RB)区域: 这些是安全、日常的科学问题。“病毒是如何感染细胞的?”或者“流感的历史是什么?”这些是无害且有益的。计算机应该自由地回答这些问题。如果它拒绝回答这些问题,说明它变得过于严苛,正在伤害科学。

大测验:用 542 个问题捕捉门卫

团队并没有凭空猜测;他们建立了一个名为 BioTIER 的大规模测试。他们在 15 位生物学和生物安全领域真实专家的帮助下,编写了 542 个特定问题(提示词)。这些问题的设计旨在模拟人们可能提出的真实情况,从简单的好奇心到复杂的、多步骤的情景。

他们将这些问题分为两组来测试计算机:

  • “拒绝”组(398 个问题): 这些是危险或棘手的问题(CA 和 BD)。计算机应该说“不”。
  • “许可”组(144 个问题): 这些是安全的问题(RB)。计算机应该说“是”。

随后,他们在来自 10 家主要科技公司(如 Anthropic、OpenAI、Google 等)的 52 个不同 AI 模型上运行了这项测试,以观察谁通过了,谁失败了。

发现:两个极端的故事

结果有点像一个教室里的学生:有的学生为了表现得好而用力过猛,而有的学生则努力不够。

“过度拒绝者”(过于严格):
一些模型,特别是来自 Anthropic 的最先进模型(如 Claude Sonnet 4.6 和 Opus 4.7),在拒绝危险请求方面表现得极其出色。事实上,它们在 96.4% 的情况下都能正确拒绝不当请求。这很了不起!但问题在于:它们做得太好了。它们也开始对安全问题说“不”。它们拒绝了约 24% 的无害生物学问题。这就像一名保安因为医生穿着一件看起来有点像用于危险实验的实验服,就阻止医生进入图书馆。他们太害怕放进坏人,以至于把好人也挡在了外面。

“拒绝不足者”(过于宽松):
在光谱的另一端,一些模型在说“不”方面表现得很差。模型 DeepSeek-V3.1 仅拒绝了 5.6% 的危险问题。这就像一个门卫让所有人进场,甚至连带着那个带着炸弹的人也不拦。这些模型在回答安全问题方面表现出色(接近 100% 的时间),但它们未能完成这项工作最重要的部分:把危险的东西挡在外面。

“中间地带”与“漂移”:
大多数模型处于两者之间。但研究人员发现的最令人惊讶的事情是,这些模型的想法会随着时间而改变。他们在五月测试了四个顶尖模型,然后在七月又测了一次。在短短两个月内,一些模型的行为发生了剧烈变化。一个模型(Gem得 Gemini 3.1 Pro)从几乎不拒绝变成了几乎拒绝一切,而另一个(GPT-5.5)在拒绝方面的表现变差了。这表明这些计算机遵循的“规则”并不是一成不变的;它们可以快速转变,这使得在没有持续检查的情况下依赖它们变得非常困难。

“模型购物”问题

论文还发现了一个可怕的漏洞,叫做**“模型购物”**。想象一下,一个坏人想知道如何制造一种危险的病毒。他们询问模型 A,模型 A 说“不”。他们询问模型 B,模型 B 也说“不”。但接着他们询问模型 C(那个只拒绝了 5.6% 的模型),模型 C 却说:“这里是指令!”

研究人员发现,如果你可以使用 六个不同的模型,你就可以获得 97.5% 危险问题的答案,即使其中一些模型是非常严格的。这意味着,拥有一个超级严格的模型并不足以保证每个人的安全。如果市面上哪怕只有一个“宽松”的模型存在,坏人就可以找到它并获取所需的信息。

总结

BioTIER 表明,我们仍在摸索如何构建完美的 AI 门卫。我们拥有的模型,有的擅长说“不”却因过度拒绝而伤害了科学,有的擅长提供帮助却因对所有事都说“是”而变得危险。

论文指出,解决方案不仅仅是让一个模型变得完美。相反,我们需要一个标准化的系统,让所有模型对什么是危险的、什么是安全的达成共识。我们还需要一种方法,让经过验证的科学家能够访问“棘手”的中间地带(即 BD 问题),同时又不让普通公众进入。

最重要的是,这篇论文证明了我们不能只是测试一次这些模型然后就置之不理。它们会改变,会发生漂移,也会有盲点。为了保护我们的生物世界,我们需要不断测试它们,不断完善规则,并确保“不”只针对坏事,而“是”始终对好事开放。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →