BioSecBench-Function: A Verifiable Benchmark for Reasoning about Biological Function from Experimental Data
该论文介绍了 BioSecBench-Function,这是一个包含七类生物安全相关问题类型、共计 111 项评估的可验证基准测试,旨在评估 AI 智能体从实验数据中准确推断生物功能的能力,并揭示了不同模型之间的显著性能差异,同时强调了成本并非准确性的可靠预测指标。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
技术摘要:BioSecBench-Function
问题陈述
从实验数据中推断生物功能是理解新兴病原体并开发应对措施的关键瓶颈。目前,这一解释过程被认为速度缓慢,且高度依赖人类专家。虽然 AI 智能体具有通过对序列、结构和生物物理数据等多种证据类型进行推理来加速该工作流的潜力,但目前缺乏标准化的、可验证的框架,来评估这些智能体是否能够可靠地从真实的生物数据集(real-world biological datasets)中恢复出与生物安全相关的功能。
方法论
为了填补这一空白,作者引入了 BioSecBench-Function,这是一个可验证的基准测试,旨在评估 AI 智能体从实验数据中恢复生物功能的能力。该基准测试基于已发表的数据集构建,并利用针对地面真值(ground truth)的确定性评分来确保评估的客观性。
该评估框架沿两个主要维度进行组织:
- 威胁轴(Threat Axis): 包含七种与生物安全相关的不同问题类型。
- 生物学问题(Biological Question): 根据解决任务所需的主要数据模态对任务进行分类,特别区分了对序列数据、结构数据或生物物理测定数据的依赖。
该基准测试包含 111 项评估。研究在 二十二 种不同的模型-工具架(model-harness)配置 下进行了 7,326 次运行,以测试性能的变异性。
关键结果
评估得出了以下性能指标和观察结果:
- 表现最优者: 当将拒绝回答(refusals)计为失败时,Opus 5(在 Claude Code 工具架下)实现了最高的终点通过率,为 50.3%。Grok 4.6(在 Grok Build 工具架下)实现了最高的整体通过率,为 44.1%。
- 性能变异性: 在不同的模型-工具架配置和特定的任务类别之间,存在显著的性能差异。
- 拒绝率: 拒绝率因 AI 提供商的不同而呈现剧烈差异。
- 成本与准确度: 研究发现,成本并不能很好地预测准确度。值得注意的是,若干配置在低成本下实现了超过 40% 的通过率。
意义与主张
本文将 BioSecBench-Function 定位为衡量 AI 智能体在高度敏感的生物安全背景下可靠性的必要标准。其核心意义在于提供一种机制,用以判断在未来的疫情爆发期间,智能体是否可以被信任去解释新病原体或变异株的功能影响。通过建立一个基于真实生物数据和地面真值的可验证基准,这项工作旨在从理论能力转向在生物安全应用中的实际、可衡量的可信度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。