← 最新论文
💻 bioinformatics

Biological rationales from language models enable leakage-resistant forecasts of target-indication success

该论文介绍了 PRIORITI,这是一个具有抗泄漏能力的框架,它利用领域指令大语言模型来合成与药物无关的生物学证据,从而生成经过校准且具有可解释性的靶点-适应症成功率预测,并在历史评估和前瞻性评估中均优于现有基准。

原作者: Zhang, W., Xu, J., Zhang, Z., Liu, M., Sun, R., Al-lazikani, B., Shen, X., Kopetz, S., Wu, L., Zhao, B., Wu, C.

发布于 2026-09-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhang, W., Xu, J., Zhang, Z., Liu, M., Sun, R., Al-lazikani, B., Shen, X., Kopetz, S., Wu, L., Zhao, B., Wu, C.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

从一个生物学构想到一种挽救生命的药物,是一条漫长、昂贵且往往令人沮丧的道路。科学家可以识别出数以千计的有前景的目标——即可能修复某种疾病的特定基因或蛋白质——以及数以千计需要被修复的疾病。但要弄清楚哪种“目标与疾病”的组合足够强大,足以支撑起建造一种药物所需的数十亿美元和数年工作量,是一个巨大的猜谜游戏。在历史上,研究人员一直依赖人类专家去筛选海量的零散数据,寻找特定基因是否真的会导致特定疾病的线索。这个过程缓慢、不均衡,且容易因见树不见林。核心挑战不在于产生想法,而在于过滤:在设计出第一个药物分子之前,确定哪些生物学假设足够稳固,值得推进。

一项新研究介绍了一个名为 PRIORITI 的系统,旨在为药物研发这一混乱的早期阶段带来清晰度。研究人员构建了一个框架,该框架使用一种大型语言模型(一种在海量文本上训练过的 AI 类型)——其目的不是去猜测药物试验的结果,而是作为一个严谨的生物学证据合成器。该系统并非要求 AI 预测一种药物是否有效,而是要求它阅读所有可用的遗传数据、动物研究和生物通路,从而构建一个清晰的、不涉及药物本身的论据,用以解释为什么一个特定基因可能治疗特定疾病。AI 被严格指令忽略任何关于现有药物、临床试验或监管审批的信息,以确保它只关注原始生物学。一旦 AI 写出这一生物学论据,一个独立的传统计算机模型就会将该论据的结构与庞大的过往药物成功与失败数据库进行对比分析,从而计算出成功的概率。

团队在数千个历史性的“目标-疾病”对上测试了该系统,其中包括一组在 AI 训练数据截止日期之后才已知结果的配对。这种“跨时空”测试至关重要,因为它证明了该系统是基于生物学逻辑进行预测,而非仅仅通过记忆过去的结果。结果令人瞩目。PRIORITI 系统能将成功的药物项目排在比失败项目更高的位置,其准确度显著优于仅观察基因名称和疾病定义的标准计算机模型,也优于直接让 AI 猜测结果而不经过结构化证据步骤的做法。该系统在识别哪些假设可能失败方面表现尤为出色,准确地将绝大多数不成功的配对标记为低概率候选对象。

该研究的一个关键发现是,其价值来自于生物学论据的结构,而不仅仅是一个简单的评分。AI 整合不同类型证据(例如人类遗传学与动物研究的契合程度)的能力,创造了一个丰富的描述,使计算机模型能够从中学习。当研究人员尝试让 AI 在没有这个结构化证据步骤的情况下直接猜测结果时,性能表现很差,且置信水平并不可靠。这表明,AI 最好的用途是作为一个“翻译官”,将杂乱、零散的科学事实转化为一个连贯的故事,随后由一个独立的统计模型利用这个故事来进行校准后的预测。此外,该系统还为每个预测提供了“原理说明”,用通俗易懂的语言解释为什么特定的“基因-疾病”对被评为高或低,使过程对人类科学家而言是透明且可审计的。

研究明确排除了该系统的成功是由于 AI 仅仅记住了过去药物试验结果的可能性。研究人员验证了 AI 很少识别出测试案例在其训练数据中的具体结果,即使识别出了,这些案例也极少,且并未驱动整体结果。他们还证明了即使在遇到从未见过的全新基因或疾病时,该系统依然有效,这证明它学会了识别生物学合理性的模式,而非仅仅记忆特定的名称。然而,作者也谨慎地指出,该系统预测的是一个生物学假设是否可靠的可能性,而非特定药物的成功率。药物可能会因为与生物学无关的原因(如剂量问题或制造问题)而失败,而一个生物学上合理的构想也可能通过意想不到的机制取得成功。

最终,这项工作为在药物进入昂贵的临床试验阶段之前,如何优先排序海量的潜在药物提供了一种新方法。通过将收集和总结证据的任务与预测结果的任务分离,研究人员创建了一个既强大又透明的工具。它并不取代人类的判断,而是提供了一个经过校准的、以生物学为先的概率,帮助研究人员决定将有限的资源集中在哪里。该系统表明,药物研发的未来不在于要求人工智能成为一个预言家,而在于利用它来构建一个清晰的、基于证据的论据,阐明为什么一种疗法可能奏效,并将最终决定权留给科学的严谨测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →