← 最新论文
🤖 machine learning

LLM-Guided Retrieval for Prediction of Molecular Perturbation Responses

本文提出了大语言模型引导的检索(LLM-Guided Retrieval, LGR),该方法利用大语言模型来识别具有生物相关性的化合物,以聚合其测得的转录组响应,从而在针对未见药物和细胞系的分子扰动效应的零样本预测方面,实现优于现有基准方法的性能。

原作者: Betty Xiong, Jan-Christian Huetter, Gabriele Scalia, Tommaso Biancalani, Sepideh Maleki

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Betty Xiong, Jan-Christian Huetter, Gabriele Scalia, Tommaso Biancalani, Sepideh Maleki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在试图弄清楚特定嫌疑人会对一种新型手铐做出何种反应的侦探。在医学世界里,这些“嫌疑人”是微小的活细胞,而这些“手铐”则是小分子药物。科学家们多年来一直在构建庞大的数据库,记录了成千上万种不同的细胞在暴露于成千上万种不同药物时的反应。这就像是拥有了一本记录了每种可能的“嫌疑人”与“手铐”组合的巨型相册。但问题在于:可能存在的组合实在太多了,以至于在物理上无法测试所有组合。你不可能在宇宙中尝试每一种药物对每一种细胞系的反应。

那么,科学家是如何预测他们尚未测试过的细胞会发生什么的呢?他们使用了一个被称为“检索”(retrieval)的聪明技巧。与其从零开始构建一台超级复杂的机器来猜测答案,不如寻找一种已经测试过的相似药物。如果药物 A 和药物 B 非常相似,而我们知道药物 A 如何改变了一个细胞,我们就可以推测药物 B 也会产生类似的反应。这就像是通过观察过去类似电影的表现,来预测一部新电影的票房一样。这个研究课题要解决的核心问题是:我们如何找到用于参考的最佳相似药物? 是观察化学结构(比如比较手铐的颜色和形状)更好,还是有更聪明的办法来寻找匹配项?

由 Betty Xiong 及其团队领导的研究人员决定尝试一种新方法:他们要求一个大型语言模型(LLM)——一种能够阅读并理解数百万本科学书籍和论文的 AI——来充当侦探的向导。他们将这种方法称为LLM 引导检索(LGR)

以下是他们的实验运作方式,使用了一个生动的比喻。想象一下,你正试图预测一种特定的、未经测试的细胞会对一种新药做出何种反应。你拥有一个包含其他已在同类细胞上测试过的药物的“候选池”。

  1. 传统方法: 通常,科学家会观察药物的化学结构。他们可能会说:“这两个药物在化学结构上很像,所以它们的表现可能也相似。”这就像仅仅通过书的封面来判断一本书的内容。
  2. 新方法 (LGR): 研究人员将新药物的名称和候选药物列表输入到 AI 中。他们要求 AI 阅读其内部的生物学知识并回答:“基于这些药物在体内的工作方式(它们的机制和通路),哪些是最匹配的?”AI 扮演的是一位博学多才的图书管理员,不仅知道书的外观,还知道书的“内核”。
  3. 预测: 一旦 AI 选出了前 10 个最相似的药物,研究人员只需计算这 10 种药物对该细胞影响的平均值。他们并不使用复杂的数学公式来猜测结果;他们只是简单地取 AI 找到的那些“邻居”的真实结果的平均值。

该论文在名为 Tahole-100M 的大规模数据集上测试了这个想法,该数据集包含了细胞对许多药物反应的数据。他们测试了三种不同的场景:

  • 未见药物(Unseen Drugs): 测试模型从未见过的药物。
  • 未见细胞系(Unseen Cell Lines): 测试模型从未见过的细胞类型(这是最具挑战性的任务)。
  • 开放世界(Open World): 让 AI 从数据库中的任何药物中进行选择,而不受限于特定列表。

他们的发现是什么?
结果表明,使用 AI 来挑选“邻居”是一个游戏规则的改变者,尤其是在处理新型细胞时。

  • 更好的方向性: 最令人兴奋的发现是关于“符号准确度”(sign accuracy)。这意味着预测一个基因是被“调高”还是“调低”。与仅仅对所有药物求平均值或使用化学相似性相比,AI 引导的方法在预测方向方面表现得好得多。它能正确猜出某种药物会增加特定基因的活性,而其他方法经常会在方向上出错。
  • “未见细胞”的胜利: 当团队尝试预测一种完全新型的细胞如何反应时,AI 方法碾压了竞争对手。它达到了 0.56 的相关系数(衡量预测值与现实接近程度的指标),而次优方法仅为 0.42。在误差方面,AI 方法的平均绝对误差(MAE)为 0.011,低于药物均值基准线的 0.0137(数值越低越好)。
  • 简约即力量: 论文指出,你不需要一个超级复杂、重型的预测模型。其“秘诀”不在于计算答案的复杂算法,而在于能否找到正确的“邻居”来进行平均。AI 完成了寻找正确伙伴的艰巨工作,而简单的平均值完成了剩下的工作。

这意味着什么?
作者认为,对于预测药物如何影响细胞,检索(寻找正确的相似药物)的质量比预测模型的复杂度更重要。他们发现,AI 作为一名受限的向导,可以挖掘出简单化学比较所忽略的生物学知识。

然而,论文也谨慎地指出,这并非解决所有问题的万灵药。如果药物非常冷门,或者 AI 在列表中找不到足够的有效匹配,它有时也会遇到困难。此外,虽然 AI 在确定效应“方向”(上升或下降)方面表现出色,但在预测精确的效应“大小”方面并不总是完美。作者建议,未来我们可以将这种 AI 向导与其他方法结合起来,以实现两全其美。

简而言之,这篇论文表明,有时预测未来的最佳方式不是建造一个更大、更聪明的水晶球,而是请一位博学多才的图书管理员来帮你找到可以学习的历史书籍。通过让 AI 指导寻找相似药物的过程,科学家可以对新疗法如何发挥作用做出更准确的预测,尤其是在初始数据非常匮乏的情况下。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →