← 最新论文
🧬 biology

AssayBench: An Assay-Level Virtual Cell Benchmark for LLMs and Agents

本文介绍了 AssayBench,这是一个包含 1,920 个 CRISPR 筛选的新基准,旨在评估大语言模型和智能体预测细胞表型结果的能力,结果表明当前的零样本通用大语言模型优于专用生物学模型,同时也凸显了构建稳健的虚拟细胞模型仍有巨大的提升空间。

原作者: Edward De Brouwer, Carl Edwards, Alexander Wu, Jenna Collier, Graham Heimberg, Xiner Li, Meena Subramaniam, Ehsan Hajiramezanali, David Richmond, Jan-Christian Hütter, Sara Mostafavi, Gabriele Scalia

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Edward De Brouwer, Carl Edwards, Alexander Wu, Jenna Collier, Graham Heimberg, Xiner Li, Meena Subramaniam, Ehsan Hajiramezanali, David Richmond, Jan-Christian Hütter, Sara Mostafavi, Gabriele Scalia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象你是一名侦探,正在试图解开一个巨大的生物学谜团。在真实的实验室中,科学家们会进行成千上万次实验,他们在细胞中“关闭”特定基因,以观察会发生什么。细胞会停止生长吗?它会生病吗?它会变得对药物产生耐药性吗?这些实验被称为CRISPR 筛选,它们会生成按重要性排序的基因庞大列表。

问题在于,在现实生活中进行这些实验既缓慢、昂贵,又杂乱无章。科学家们希望拥有一个“虚拟细胞”——一个超级智能的计算机程序,能够在他们接触培养皿之前就预测这些实验的结果。

本文介绍了AssayBench,这是一项新的“期末考试”,旨在测试我们当前的人工智能(AI)模型是否足够智能,能够成为那个“虚拟细胞”。

以下是本文的分解说明,使用了简单的类比:

1. 新考试:AssayBench

在这篇论文之前,AI 模型主要是在狭窄的任务上进行测试,例如预测单个分子如何改变形状。但真正的药物发现更像是一部电影剧情:你需要理解角色(基因)、背景(细胞类型)以及情节转折(药物处理),才能猜出结局(表型)。

作者利用1,920 个已发表的现实世界实验构建了AssayBench

  • 任务:AI 会收到一个实验的文本描述(例如:“我们在白血病细胞中关闭了基因,并添加了一种名为依托泊苷的药物,以观察哪些细胞存活了下来”)。
  • 目标:AI 必须输出一个排名前 100 的基因列表,按它认为导致该效应的可能性从“最可能”到“最不可能”进行排序。
  • 转折:AI 必须针对它从未见过的实验完成此任务,就像一名学生在参加关于其学习过但未曾专门练习过的主题的考试一样。

2. 评分系统:“调整后的分数”

你如何对一份包含 1,000 个基因的列表给 AI 评分?如果你只问“它猜对第一个了吗?”,这太苛刻了。如果你问“它猜对任何一个了吗?”,这又太容易了。

作者创建了一种特殊的评分指标,称为Adjusted nDCG。这就像高尔夫差点

  • 有些实验很简单(就像平坦的高尔夫球场);有些则很难(就像带有沙坑的球场)。
  • 该指标会调整分数,使 AI 在击败“随机猜测”基线时获得加分,但不会仅仅因为实验简单就获得满分。
  • 如果 AI 将“坏”基因(实际上会使问题恶化的基因)排在列表顶部,它也会受到惩罚。

3. 参赛者:谁参加了?

作者测试了三类“学生”:

  1. 通才天才(前沿大语言模型):这些是庞大的、通用的人工智能模型(如 Gemini 3 Pro 或 GPT-5.4),它们几乎阅读了互联网上的所有内容。它们并非专门为生物学训练;它们只是对万事万物都知之甚多。
  2. 生物学专家:这些是专门针对生物数据训练的 AI 模型,或者是设计为充当医疗代理的模型。
  3. “小抄”基线:简单的查找模式的方法,例如“哪些基因通常在这类实验中很重要?”

4. 结果:通才获胜(目前为止)

令人惊讶的是,通才天才(大型通用 AI 模型)表现最好。

  • 专家模型的表现实际上比通用模型还要差。
  • “小抄”基线出人意料地具有竞争力,尤其是对于常见的细胞类型,这表明有时简单的模式就足够了。
  • 裁决:即使最好的 AI 模型也远非完美。论文显示,当前最佳 AI 的得分大约仅为理论可能值(“性能上限”)的一半。如果你让两位真实的科学家预测同一个实验,他们的意见很可能比 AI 更加一致。

5. “死记硬背”陷阱

作者注意到一个有趣的现象:AI 在较旧的实验(2021 年之前发表)上的表现要好得多,而在非常近期的实验(2025 年底发表)上表现较差。

  • 类比:这就像一名学生死记硬背了去年练习题的答案,却在应对今天考试中的新问题时感到吃力。
  • 结论:AI 很可能是在“死记硬背”其训练数据中读到的事实,而不是真正理解生物学逻辑。然而,它在测试上的表现仍然优于专家模型,这表明它具备某种真正的推理能力,而不仅仅是记忆。

6. 如何变得更好?

论文测试了几种提升 AI 性能的方法:

  • 微调:专门针对这类问题训练 AI 有少许帮助。
  • 集成:让三个不同的 AI 对答案进行投票并合并结果,效果最好。这就像咨询专家小组,而不是只咨询一个人。

核心结论

AssayBench 是一项新的、现实的测试,用于评估 AI 能否预测当我们干扰基因时细胞将如何表现。

  • 当前状态:AI 在这方面正变得擅长,但尚未到位。最好的模型仍然会犯真实科学家不会犯的错误。
  • 未来:论文建议,要构建真正的“虚拟细胞”,我们需要能够进行生物学推理而不仅仅是死记硬背事实的模型,并且我们需要更多数据来教导它们。

本文并未声称这些模型已准备好用于医院或今日治愈疾病。它只是说:“这里有一把尺子,用来衡量在 AI 真正取代实验台之前,我们还有多远的路要走。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →