← 最新论文
💻 computer science

Plausibility Is Not Prediction: Contrastive Evidence for LLM-Based Cellular Perturbation Reasoning

本文表明,尽管大语言模型能够生成具有生物学合理性的细胞扰动解释,但由于缺乏对比性证据,它们无法准确预测特定结果,而所提出的 CORE 框架通过将预测重新定义为利用相关扰动结果进行比较的任务,克服了这一局限性,从而显著提高了准确性和校准度。

原作者: Xinyu Yuan, Xixian Liu, Jianan Zhao, Yashi Zhang, Hongyu Guo, Jian Tang

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyu Yuan, Xixian Liu, Jianan Zhao, Yashi Zhang, Hongyu Guo, Jian Tang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图预测你体内的某个特定细胞会对一种新药做出何种反应。你想知道:这种药物会让一个特定的基因“开启”还是“关闭”?

长期以来,科学家们一直尝试使用大语言模型(LLMs)——即那些能写论文、能和你聊天的同类 AI——来充当“虚拟细胞”。其核心思路是:“如果你把所有的生物学事实都交给 AI,它就能像人类科学家一样进行推理,从而得出答案。”

这篇论文指出,这种方法是失效的,并不是因为 AI 不够聪明,而是因为它玩错了游戏。以下是简单的解析。

1. 问题所在:“合理性”并不等于“预测力”

作者发现,目前的 AI 方法擅长讲述一个动听的故事,但在做出准确预测方面却表现糟糕。

  • 类比: 想象你是一名侦探,试图猜测一名嫌疑人是否实施了犯罪。
    • 旧的 AI 方法: 你问 AI:“这个嫌疑人有动机吗?” AI 说:“有的!他恨受害者,当时就在镇上,而且有暴力前科。” AI 写出了一个逻辑严密、极其合理的关于嫌疑人“可能”作案的故事。
    • 现实情况: 嫌疑人其实并没有犯罪。AI 被故事的合理性给骗了,忽略了嫌疑人当时身处他处的实际证据。

用论文中的术语来说,AI 在观察一种药物和一个基因时会说:“哦,从生物学角度看,这两者可能会发生相互作用”,并预测“是的,基因会发生变化”。但实际上,基因往往保持不变。AI 过度自信,并且高估了基因发生变化的频率。

2. 为什么 AI 会失败?

论文指出了导致这种失败的两个主要原因:

  • 孤立性: AI 被要求在真空环境下观察单个药物和单个基因。它不知道其他类似的药物对同一个基因产生了怎样的影响。
  • “热门基因”陷阱: 有些基因天生就很“吵”(活跃),经常发生变化;而有些则很“安静”。AI 学会了直接对“吵”的基因猜“是”,对“安静”的基因猜“否”,从而忽略了具体的药物。它通过查看基因的历史记录来“作弊”,而不是观察药物的具体效应。

3. 解决方案:CORE(“对比与对照”法)

为了解决这个问题,作者创建了一个名为 CORE(对比式关系证据组织)的新系统。

  • 类比: 与其让侦探在真空中进行猜测,不如给他们一块对比板
    • 设定: 你有一个神秘药物(药物 A)和一个基因。
    • 证据: CORE 找到了 5 种与药物 A 非常相似的其他药物。
    • 对比: 它向 AI 展示:
      • “药物 B(与 A 相似)确实改变了这个基因。”
      • “药物 C(与 A 相似)并未改变这个基因。”
    • 任务: AI 现在必须弄清楚:“药物 A 更像药物 B 还是更像药物 C?”

通过强制 AI 进行比较相似的情况,它不再根据模糊的“感觉”进行猜测,而是开始观察真正重要的具体差异。

4. 结果:从猜测转向推理

论文在真实的生物数据(例如癌症细胞对药物的处理)上测试了这种新方法。

  • 之前(旧 AI): AI 经常出错,倾向于过度猜测“是”,并且在观察单个基因时,表现并不比简单的抛硬币随机猜测好多少。
  • 之后(CORE):
    • AI 变得更加精准(校准度更高)(它不再对所有情况都猜“是”)。
    • 它在区分有效药物和无效药物方面表现得显著更好。
    • 即使不使用复杂的 AI,一个基于简单数学逻辑的 CORE 版本(称为 CORE-Voting)也优于复杂的 AI 方法。

核心结论

这篇论文的主要观点很简单:仅仅因为一个解释在生物学上听起来合理,并不意味着预测就是正确的。

要让 AI 在科学领域变得可靠,你不能只让它去“思考”单个案例。你必须给它一个比较性的语境——展示过去类似情况中发生了什么——这样它才能学会区分一个“可能的”故事与一个“概率性的”结果。

注: 本文严格侧重于利用更好的证据组织方式来提高这些预测的准确性。它并不声称该系统已准备好取代人类医生,也不声称可以立即用于临床治疗;它是朝着让“虚拟细胞”模拟器真正变得值得信赖迈出的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →