✨ 要点🔬 技术摘要
为现有药物寻找新的用途是加速医学进步最充满希望的方式之一。科学家们不再从零开始发明新药——这一过程可能耗时十多年并耗资数十亿美元——而是寻找能够重新利用那些已被证明对人体安全且已有的化合物的方法。挑战在于如何将特定的疾病与特定的药物联系起来。现代遗传学为这一旅程提供了一张强大的新地图。通过研究我们的 DNA 变异如何影响基因活性,研究人员可以识别哪些基因很可能在驱动某种疾病。如果发现某个基因在患有特定疾病的患者体内过度活跃,那么逻辑上的治疗方法可能是使用一种能降低该基因活性的药物。如果一个基因活性不足,目标则是提高其活性。这种被称为“方向性”的逻辑至关重要:如果给一个本身已经活动过度的患者使用一种增加活性的药物,可能会使病情恶化。然而,将这些遗传线索转化为一份可行的候选药物清单,传统上是一个缓慢且依赖人工的过程,需要科学家阅读数千篇研究论文并逐一交叉比对复杂的数据库。
现在,一组研究人员开发了一个名为 TRACE 的数字工具,以实现这一艰巨工作的自动化。该系统充当了一个高度专业化的研究助手,能够获取与某种疾病相关的基因列表,并快速扫描全球医学文献以寻找可能治疗该病的药物。整个过程始于科学家向该工具提供一个基因名称和一个方向,例如“这个基因在某种疾病中过于活跃”。该工具首先检查四个主要的公共数据库,查看哪些经 FDA 批准的药物已知会与该基因发生相互作用。随后,它会对该列表进行过滤,仅保留在美国获得官方批准用于临床的药物。接着,系统进入 PubMed(一个庞大的医学研究档案库),调取最新的摘要,描述这些特定药物是如何影响该特定基因的。
TRACE 的核心创新在于其阅读和理解这些科学摘要的能力。研究人员训练了一个计算机模型,这是一种专门处理生物医学语言的人工智能,使其充当一名批判性读者。该模型会检查每篇研究摘要,以确定三件事:文本是否证实了药物与基因之间的关系、这种关系的机制是什么,以及最重要的一点,该药物是将基因的活性调高还是调低?该模型是通过数千个示例进行训练的,其中包括来自以往科学竞赛的专家标注数据,这使得它能够学习区分“抑制基因”与“激活基因”之间的细微差别。一旦模型完成了证据分类,它会将药物的效果与原始遗传线索进行对比。如果遗传数据表明该基因过于活跃,而药物的作用是降低其活性,系统就会将其标记为一个具有前景的治疗候选对象。如果药物的作用是提高其活性,系统则会将其标记为一个潜在的安全风险,警告使用该药可能会产生危害。
研究人员测试了该系统是否能够复制人类专家的工作。他们首先将其应用于与子宫内膜异位症(一种影响子宫内膜的疼痛性疾病)相关的基因集。他们拥有一个由人类专家手动整理并验证的、包含 43 对“药物-基因”组合的现有列表。当该工具运行相同的数据时,它成功找回了其中近 91% 的已知配对。它正确识别了绝大多数的有益候选药物以及危险的安全隐患。该系统还证明了其自主重新发现已知疗法的能力:在分析完整的子宫内膜异位症基因列表时,它仅通过分析文献和遗传方向,在没有任何关于该药物用途的预知情况下,就独立识别出了醋注乐谱酮(leuprolide acetate)——这是一种针对该病症的成熟疗法。
除了已知案例外,该工具还将搜索范围扩大到了与子宫内膜异位症相关的 99 个基因,并发现了 1000 多种潜在的药物-基因相互作用。从这个庞大的池中,它强调了 32 对作为新治疗方案的强力候选对象,并将 77 对列为潜在的安全隐患。该系统还在另外两种疾病(一种脂肪肝疾病和 2 型糖尿病)上验证了其性能。在这些案例中,它找回了其所检索数据库中存在的近 90% 的药物配对。研究人员强调,该工具并不证明这些药物可以治愈疾病;相反,它提供了一个高度组织化、基于证据的研究起点。它过滤掉了噪音,并呈现出一份经过优先排序的假设清单,供实验室或临床试验进行测试。通过将阅读和交叉比对的繁琐工作自动化,TRACE 让科学家能够更快地从遗传发现转向治疗构想,将曾经需要数月人工劳动完成的任务,转变为在标准计算机上仅需几小时即可完成的任务。
TRACE 技术摘要:一种用于方向性知情药物重定位的微调生物医学语言模型
问题陈述 全转录组关联研究(TWAS)能有效识别基因表达的遗传预测值与疾病风险相关的基因。然而,将这些遗传信号转化为可操作的治疗假设仍然是一个瓶颈。目前的标准流程涉及人工策展:研究人员必须单独搜索药物-基因数据库,审查机制文献,确定药物是抑制还是激活特定基因,并将该方向与 TWAS 的效应估计值进行比较。这一过程耗时、难以大规模复现,且难以扩展到数百个基因。虽然系统生物学方法(如 Connectivity Map)提供了可扩展性,但它们往往缺乏后续临床转化所需的基因特异性、基于文献的解释。
方法论:TRACE 流水线 作者开发了 TRACE (通过 AI 辅助证据策展实现的 TWAS 驱动重定位),这是一个旨在自动化策展步骤的基因和表型无关的计算流水线。该流水线通过以下阶段运行:
输入与标准化: 系统接受一个基因符号和一个 TWAS 衍生的效应方向(正向或负向)。基因符号通过 HGNC REST API 被标准化为官方 HGNC 命名法。
候选药物检索: 流水线查询四个药物-基因相互作用资源:药物-基因相互作用数据库 (DGIdb)、Open Targets、CTD 和 Pharos。候选药物被汇集、去重,并严格过滤为经由 openFDA API 和 RxNorm 标准化的 FDA 批准化合物。
文献检索: 对于每个 FDA 批准的药物-基因对,系统通过结合官方基因符号和标准化药物名称,利用 NCBI E-utilities 检索最多七篇 PubMed 摘要。
微调分类: 一个基于 BiomedBERT (具体为 microsoft/BiomedNLP-BiomedBERT-base-uncased-abstract-fulltext)构建的本地分类器处理摘要。系统在 [CLS] 标记上添加了三个分类头,以同时预测:
关系 (Relationship): 摘要是否支持直接的药物-基因关系?
机制 (Mechanism): 作用机制是什么?
方向 (Direction): 药物是上调/激活还是下调/抑制该基因?
注: 对于存在关系但方向不明的摘要,系统将其标记为 unclear_direction_manual_review(方向不明,需人工复核),而不是强制归入某一类别。
优先级排序: 流水线将文献衍生的药物效应方向与 TWAS 风险方向进行比较。
一致 (Concordant): 标记为候选治疗对 。
不一致 (Discordant): 标记为潜在安全性问题 。
不明确 (Unclear): 标记为待人工复核。
这些配对根据包含证据强度、数据库支持、分类器置信度和摘要数量的综合评分进行排名。
训练与模型性能 该模型在一个不断演进的数据集上进行迭代训练,该数据集从流水线衍生的示例发展到包含 BioCreative VI ChemProt 金标准语料库以及主动学习中的分歧案例。
最终数据集: 18,880 个示例(包括 12,422 个金标准示例)。
性能: 在 2,833 个留出集示例上,模型在三项任务中实现了 0.809 的宏 F1 值 (macro F1) 。
关系检测:91% 准确率,0.88 宏 F1。
机制分类:84% 准确率,0.78 宏 F1。
方向分类:83% 准确率,0.73 宏 F1。
开发说明: 虽然在开发过程中使用了 Claude API 来生成标签并识别分歧案例,但所有报告的验证和应用结果均使用本地微调的模型生成,未调用外部 API。
关键结果 该流水线针对三种疾病背景进行了验证:
子宫内膜异位症(内部验证): 对抗 43 个药物-基因对的人工策展金标准,TRACE 找回了 90.7% 的配对(88.9% 的治疗对,92.0% 的安全性对)。由于在摘要缺乏明确机制陈述时采用了保守的“方向不明”标签分配,其实际分类准确率为 46.5%。
MASLD 与 2 型糖尿病(外部验证):
MASLD: 找回了 88.2% 的已发表配对。
2 型糖尿病: 总体找回了 65.0% 的配对;然而,当限制在至少存在于一个查询数据库中的配对时,调整后的召回率上升至 92.9% 。
应用于子宫内膜异位症 TWAS 基因: 应用于 99 个子宫内膜异位症相关 TWAS 基因,该流水线识别出 1,089 个 FDA 批准的药物-基因对 ,包括 32 个候选治疗对和 77 个潜在安全性问题。
阳性对照: 流水线独立找回了针对 GNRH1 基因的 醋酸亮丙瑞林 (leuprolide acetate) (一种已知的子宫内膜异位症治疗用 GnRH 受体激动剂),验证了其仅凭自动化证据重新发现既定疗法的能力。
新假设: 系统提出了如依奈珠单抗 (erenumab, 针对 CALCRL ) 和塞来替尼 (selumetinib, 针对 RIT1 ) 等候选药物,分别通过 CGRP 和 MAPK 信号通路将其与子宫内膜异位症生物学联系起来。
意义与主张 作者将 TRACE 定位为连接遗传发现与治疗假设生成的、具有可扩展性和可重复性的桥梁。其核心主张包括:
可扩展性: 流水线自动化了逐个基因策展的瓶颈,在标准 HPC 节点上处理 99 个基因仅需约两小时,且无需每次查询的 API 成本。
可解释性: 与广泛的特征匹配方法不同,TRACE 提供了基于基因特异性、文献支撑的药物-靶点关系解释。
保守实用性: 系统优先考虑高召回率和透明度。通过频繁分配“方向不明”标签而非强行进行错误分类,它减少了过度声明,并作为人类专家的有效分诊工具。
局限性: 作者明确指出 TRACE 并不建立治疗有效性。它产生的是经过优先排序的假设,需要通过孟德尔随机化、电子健康档案 (EHR) 分析和实验随访进行下游验证。目前的性能受限于源药物-基因数据库的覆盖范围以及排除了非 FDA 批准化合物。
总之,TRACE 提供了一个“方向性知情”的框架,在实现快速、系统地筛选 TWAS 结果以进行药物重定位的同时,保留了人工策展的生物学可解释性。
每周获取最佳 genetic and genomic medicine 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。