BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance
该论文介绍了 BioSecBench-Surveillance,这是一个可验证的基准测试,它表明即使是目前最先进的 AI 智能体在可靠推断病原体监测所需的基因组分析流程方面也面临困难,在多种任务中的准确率仅为 50% 左右。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,公共卫生领域就像是一个规模宏大、赌注极高的侦探机构。他们的职责是发现那些看不见的“反派”——病毒、细菌和其他病原体——以免它们在引发全球性流行病(如大流行病)之前就开始大肆破坏。为了做到这一点,科学家们使用了一种超强大的显微镜,叫做“基因组监测”。这不仅仅是在镜头下观察一个微生物,而是通过阅读它的完整“说明书”(其 DNA 或 RNA),来弄清楚它究竟是什么、来自哪里以及它有多危险。
长期以来,难点在于如何获取足够的这些“说明书”。但现在,机器读取它们的能力已经非常出色,以至于我们正面临着数据过载的问题。真正的瓶颈已经发生了转移:不再是关于如何寻找线索,而是关于如何破解谜题。这就是人工智能(AI)智能体介入的地方。把这些智能体想象成超级聪明、不知疲倦的初级侦探。它们可以在几秒钟内阅读数百万页的内容。但这里有一个核心问题:这些 AI 侦探真的能破案吗,还是仅仅迷失在了图书馆里?它们能否面对一堆杂乱无章的遗传学线索,并像人类专家一样做出判断:“好吧,我需要使用这个特定的工具,并配合这些特定的设置来找到答案”?
这篇名为 BioSecBench-Surveillance 的论文,就像是为这些 AI 侦探准备的一场规模巨大且极其严格的期末考试。研究人员创建了一个“可验证的基准测试”——一个包含 100 个不同场景的标准测试。在测试中,AI 智能体会获得原始的遗传数据和一个特定的监测背景(例如“这是来自某个城市的废水”或“这是来自医院的样本”)。AI 必须从零开始确定正确的分析流程:应该检查哪些数据库、应用哪些过滤器,以及设置哪些阈值,而无需被告知答案。
考试结果给人们带来了一些现实的警示。在测试的 16 种不同 AI 模型与软件工具的组合中,表现最好的组合也仅答对了约 50.2% 的题目。这意味着即使是最聪明的 AI 智能体也会在半数情况下失败。顶尖的组合是名为 Opus 4.8 的模型搭配 PI 工具,以及 GPT-5.5 搭配 Codex,两者的得分均为 50.2%。紧随其后的是得分 49.6% 的 Opus 4.7 和得分 48.6% 的 Sonnet 4.6。而最弱的配置,比如某些版本的 Grok,仅能完成约 14% 到 16% 的任务。
研究发现,AI 智能体失败的原因通常并不是因为它们不知道该使用哪些工具。事实上,它们几乎总是能选对“侦探工具”(例如用于读取 DNA 的正确软件)。它们的错误发生在细节之处:它们选错了参考书籍,设置了错误的灵敏度阈值,或者在进行数据归一化时算错了数学题。这就像一个侦探知道自己需要指纹扫描仪,却把灵敏度调得太高,导致错过了指纹;或者调得太低,以至于把一个污点误认为匹配。
测试的难度因案件类型而异。对 AI 来说最简单的任务是溯源(确定样本的来源)和分类学鉴定(命名生物体),它们的正确率分别约为 50% 和 46%。然而,AI 在异常检测(识别奇怪、意外的信号)方面表现得极为吃力,正确率仅为 20%。它们在基因工程特征鉴定(检测病毒是否经过人工改造)方面也遇到了困难,得分仅为 35%。有趣的是,样本类型(如废水与临床样本)的重要性并不如所使用的“技术”那么大。长读长测序数据(long-read sequencing data)对 AI 来说比短读长数据(short-read data)要难得多(通过率为 26%,而短读长为 41%)。
研究人员还注意到,一些 AI 模型过于“胆小”。在约 27% 到 31% 的情况下,某些模型会拒绝回答问题,声称无法处理,而另一些模型则几乎从不拒绝。这种“拒绝率”因模型运行的软件“框架”不同而表现出巨大的差异。
最终,论文得出结论:虽然 AI 智能体正在进步,但它们还不足以可靠到可以被信任为病原体监测中的唯一决策者。它们可以执行分析,但往往会在“如何执行分析”的判断上出错。作者指出,在 AI 能够可靠地做出这些细微的选择(例如明确知道该信任哪份参考资料或设置哪个阈值)之前,我们无法完全依赖它们。目前,人类专家仍然是掌控案件最终裁决权的人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。