BenchBench-Protocol: Evaluating Real-World Wet-Lab Protocol Reasoning and Modification
该论文介绍了 BenchBench-Protocol,这是一个源自科学家对已发表实验方案进行的真实世界修改的创新基准测试,用于评估大语言模型对湿实验操作进行推理和适配的能力,并揭示了目前的顶尖模型在处理这些常规但复杂的任务时仅取得了中等程度的成功。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在实验室里,科学家很少会完全照搬印刷好的配方。湿实验生物学的世界是由适应性定义的。实验方案(protocol)仅仅是一个详细的实验指令集,它通常只是一个起点。当研究人员将该实验转移到新的细胞类型、不同的机器或略微不同的化学环境时,他们必须修改步骤。这不仅仅是改变一个数字,而是要理解这一变化如何波及整个过程。如果科学家改变了第一步的温度,他们可能需要调整第三步的时间,或者在最后一步更换一种化学试剂。正确地做到这一点,需要对因果关系有深刻的实践性理解,因为中间的一个小错误可能会毁掉最终的结果。几十年来,这种推理能力一直是一种独特的人类技能,依赖于经验和直觉,而计算机一直难以模仿这种能力。
Benchling 公司的研究人员(该公司致力于为科学家构建软件)创造了一种新方法,来测试人工智能是否能够掌握这种特定的思维方式。他们引入了一个名为 BenchBench-Protocol 的测试。他们没有要求计算机解决一个虚构的问题或背诵教科书中的事实,而是给了它一个现实世界的挑战:拿取一个已发表的科学实验方案,并根据新的情况对其进行修改,就像人类科学家所做的那样。研究团队并没有从零开始发明这些挑战。他们查看了在 Benchling 平台上由真实科学家进行的数千个实际实验。他们发现,有些科学家在采取标准的、已发表的实验方案时,会为了满足其特定需求而对其进行修改。通过对比原始指令与科学家修改后的版本,研究人员提取出了人类所使用的确切逻辑。随后,他们将这些现实生活中的变化转化为了 149 个截然不同的测试问题。每个问题都要求人工智能解释它将如何调整实验方案,并且至关重要的一点是,要说明为什么这些改变是必要的。
为了确保这些测试公平且准确,研究人员并没有依靠计算机来评分。他们请来了人类专家。这 149 个任务均由拥有高级学位并在实验室工作至少三年的科学家进行了评审。这些专家检查了问题是否合理、正确答案的规则是否具有科学依据,以及该任务是否真正反映了现实中科学家的工作内容。他们仅保留了那些在质量和相关性方面获得最高评分的任务。最终的集合涵盖了生物学的九个不同领域,从蛋白质和细胞研究到 DNA 测序和微生物培养。其目标是创建一个基准,用以衡量机器是否能够推理出变化的下游后果,而不仅仅是猜中正确答案。
随后,研究人员对九种不同的 AI 模型进行了测试。这些模型被给予了原始实验方案、一个关于新实验目标的描述,以及可以用于查找信息的搜索工具。它们被要求写一段自由形式的回应,解释如何修改该实验方案。回答随后根据经过专家验证的规则进行评分。结果显示,尽管这些模型已经取得了显著进展,但仍有很长的路要走。表现最好的模型 Claude Opus 5 获得了 59.2% 的分数。这意味着它在超过一半的情况下,能够正确处理必要的变更及其后果。其他模型的得分在 34.1% 到 47.1% 之间。即使是表现最好的模型也留下了大量未获得的学分,这表明该测试具有难度,且模型尚不完美。
研究还观察了当允许一个模型尝试同一个问题多次时(模拟科学家在做决定前可能会进行模拟或检查几种不同选项的情况)会发生什么。当研究人员取十次尝试中的最佳答案时,得分有所提高,但模型之间的差距发生了变化。一些在单次尝试中表现平平的模型在获得多次机会后变得更强,而另一些则保持了一致性。这表明不同的模型具有不同的优势:有些模型更可靠,而另一些如果运气好,则更有可能产生一个精彩的答案。然而,即使经过十次尝试,最好的模型仍然未能获取所有可用分数,证明该基准测试尚未“饱和”,即对于当前技术而言并不容易。
研究人员发现,模型的表现取决于任务类型的不同。在需要查看实验证据并得出逻辑结论的任务上,它们的表现相对较好。然而,在需要“默会知识”(tacit knowledge)——即专家对于在混乱、真实的现实环境中什么是极有可能或最佳方法的直觉或感悟——的任务上,它们表现得更为吃力。这在故障排除(troubleshooting)任务中尤为明显,即模型需要弄清楚实验为何失败以及如何修复它。此外,模型在利用搜索工具的程度上也各不相同。一些模型(如 Grok)通过广泛搜索互联网消耗了海量数据,而另一些则更为保守。研究指出,这些高推理设置(允许模型进行深度思考和广泛搜索)在计算能力和时间方面也带来了高昂的成本。
最终,这项工作为衡量人工智能在科学领域的进展提供了一种接地气的方法。通过将测试建立在真实科学家所做的实际修改之上,研究人员避免了创造无法反映实际实验室工作复杂性的虚构问题的陷阱。研究结果表明,虽然人工智能正在成为科学家有力的助手,但它还不能取代实验室中的人类判断。模型可以回忆事实并遵循指令,但在处理安全且有效地调整科学方案所需的细致、循序渐进的推理方面,仍然面临困难。随着这些工具在研究中变得越来越普遍,像 BenchBench-Protocol 这样的基准对于理解它们的成功之处以及仍需学习之处将至关重要。未来的路径不仅在于让模型变得更聪明,还在于教它们理解定义科学方法的因果链条。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。