← 最新论文
📄 medicine

LLM-assisted large-scale curation of peptide clinical trials maps trends in therapeutic development and trial outcomes

本研究提出了一种经过验证的大语言模型辅助工作流,用于整理和分析 6,834 项多肽临床试验,结果表明,尽管注射给药方式占据主导地位,且与普通药物相比,后期阶段的失败较少归因于毒性,但整体各阶段的成功率仍然较低。

原作者: Emily Zhang, Uluc Birol, Maya Alev, Iris Caglayan, Emre Demirsoy, Mercan Deniz, Ali Salehi, Berke Ucar, Anat Yanai, Inanc Birol

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Emily Zhang, Uluc Birol, Maya Alev, Iris Caglayan, Emre Demirsoy, Mercan Deniz, Ali Salehi, Berke Ucar, Anat Yanai, Inanc Birol

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

几十年来,医学界一直严重依赖两种主要的药物分子:一种是像钥匙与锁一样契合身体的小分子化合物,另一种是像重型机械一样的巨型生物蛋白质。在这两个极端之间,存在着一个被称为多肽的中间地带。多肽是氨基酸的短链,而氨基酸正是构成我们肌肉和器官中蛋白质的相同构建模块。由于它们是由自然界的材料构建的,因此多肽可以极其精准,在针对特定疾病的同时,通常能减少对免疫系统的意外反应。自第一种多肽药物——胰岛素在20世纪20年代开始用于治疗糖尿病以来,科学家们一直渴望创造更多此类药物来对抗癌症、代谢紊乱和感染。然而,将这些充满前景的分子转化为真正的药物却极其困难。多肽在体内分解过快,或者难以穿透细胞膜以到达其目标位置。虽然研究人员已经开发了许多方法来解决这些问题,例如改变化学结构或寻找新的给药方式,但很难看到全局性的规律。多肽药物开发的历史散落在数以千计的独立临床试验中,埋藏在非结构化的文本里,这使得人们很难了解哪些策略真正奏效,而哪些策略会导致死路一条。

一个研究团队决定使用一种新型数字工具来绘制这一广阔且无序的图景。他们没有雇佣大量的专家去逐一阅读数十年的试验记录,而是训练了一个人工智能系统来承担这项繁重的工作。这个系统是一个大语言模型,它被教导去阅读公开的临床试验记录,并提取特定的关键细节:药物是如何递送到患者体内的、多肽的确切化学序列、试验是成功还是失败,以及失败的具体原因。为了确保机器不仅仅是在瞎猜,研究人员首先用一组由人类志愿者精心标注过的试验对它进行了测试。他们发现,人工智能与人类专家达成一致的频率,几乎与两名不同的人类专家之间达成一致的频率一样高。这种验证给了他们信心,让他们让机器阅读一个包含6,834项多肽临床试验、跨越三十多年的庞大数据集,而这项任务如果交给人类团队完成则需要数年时间。

由此生成的药物开发图谱揭示了一个由一种特定给药方式主导的领域。绝大多数试验(接近74%)依靠注射或输液将药物送入体内。这包括皮下注射、肌肉注射或直接进入血液。虽然口服药物是人们服用药物最常见的方式,但在该数据集的多肽试验中,口服占比不足15%。这种对针头的沉重依赖凸显了一个持久的挑战:多肽非常脆弱,往往无法在消化系统的恶劣环境中生存。尽管注射会带来不适和不便,但这种方法仍然是确保药物到达目标的可靠途径。数据还显示,虽然研究人员正在尝试不同的多肽链长度和化学电荷,但并没有一种单一的“完美”尺寸或电荷能保证成功。成功的试验和失败的试验在这些物理特性上呈现出广泛的混合,这表明答案在于更复杂的生物学特征,而非简单的测量指标。

当研究人员观察这些试验的成功率时,他们发现了一个模式,该模式反映了普遍的药物开发过程,但又带有一些独特的转折。在被称为1期(Phase 1)的早期测试阶段,其主要目标是检查药物对人类是否安全,大约有26%的多肽试验得以推进。在被称为2期(Phase 2)的中期阶段,即测试有效性的阶段,成功率上升至约33%。最高的成功率出现在3期(Phase 3),即在药物获批前的最后大规模测试阶段,近58%的试验报告了积极结果。这是一个显著的发现,因为在更广泛的药物开发领域,由于在成千上上人身上进行测试的成本高昂且复杂,最后阶段往往是失败最多的地方。然而对于多肽而言,数据表明,如果一个候选药物能够通过早期的安全性障碍并进入最后阶段,它就有很强的机会证明其有效性。

这项分析中最令人惊讶的洞察或许在于这些试验为何失败。在一般的制药领域,安全问题和毒性是停止试验的主要原因,尤其是在后期阶段。然而,对于多肽药物,安全性很少是罪魁祸首。在最后的3期试验中,只有约4%的失败是由于药物具有毒性或不安全造成的。相反,停止多肽试验的压倒性原因是药物根本无法按预期发挥作用。这种缺乏有效性的情况占了所有失败案例的三分之一以上。另一部分显著的试验结束并非因为科学问题,而是因为商业决策、资金问题或难以找到足够的志愿者参与。研究人员还注意到,具有积极结果的试验往往涉及规模更大的受试人群,这表明拥有稳健的研究设计和充足的资源对于展示药物的真实潜力至关重要。

通过将这段混乱的历史组织成清晰、结构化的数据集,这项研究提供了一种理解多肽药物历程的新方法。它证实了虽然通往获批的道路漫长且昂贵,每个阶段平均耗时数年,但多肽面临的最后障碍与其说是安全性,不如说是证明其有效性。该研究还证明了人工智能可以成为科学研究的强大伙伴,能够以匹配人类专家的准确度来阅读和理解复杂的医疗记录。这种方法使科学家能够回顾数十年的数据,以识别此前隐藏的模式,为下一代多肽药物提供更清晰的路线图。随着研究人员继续开发新的给药方式(无需针头)以及工程化更稳定的分子,这种对过去的大规模审视为预测未来哪些策略将会成功奠定了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →