← 最新论文
🧬 biology

FUSION: a multimodal graph-based structural AI framework for interpretable somatic cancer driver mutation prediction

本文介绍了 FUSION,一种多模态图神经网络 AI 框架,该框架整合了蛋白质语言模型嵌入、源自 AlphaFold2 的结构拓扑以及构象系综,用以准确预测并解释体细胞癌症驱动突变,特别是针对缺乏既往临床证据的罕见错义变异。

原作者: Lucas Moraes dos Santos, Tatiane Senna Bialves, Luana Luiza Bastos, José Gutembergue de Mendonça Silva, Sheila Cruz Araujo, Janaina de Oliveira Melo, Adriano de Paula Sabino, Eduardo Tarazona-Santos
发布于 2026-08-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Lucas Moraes dos Santos, Tatiane Senna Bialves, Luana Luiza Bastos, José Gutembergue de Mendonça Silva, Sheila Cruz Araujo, Janaina de Oliveira Melo, Adriano de Paula Sabino, Eduardo Tarazona-Santos, Leonardo Henrique França de Lima, Gerd Bruno da Rocha, Eduardo Moraes Reis, Wagner Meira Junior, Raquel Cardoso de Melo-Minardi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

当人体细胞开始失控生长时,癌症便开始了,这通常是因为其遗传密码中出现了微小的错误。这些被称为“突变”的错误,就像汽车中卡住的加速器,迫使细胞在应该休息时进行分裂。科学家们将驱动这一过程的危险突变称为“驱动突变”(drivers),而那些随之发生的无害突变则被称为“乘客突变”(passengers)。几十年来,寻找驱动突变就像是在海量的遗传数据这一巨大的草堆中寻找几根特定的针。挑战在于,许多驱动突变非常罕见;它们仅出现在极少数患者身上,或出现在蛋白质的特定部位,这使得依赖于观察重复出现的错误来识别问题的标准工具难以发现它们。此外,要理解为什么一个突变会导致癌症,通常需要观察其影响的蛋白质的三维形状,而不仅仅是DNA中的字母序列。

一个研究团队开发了一种名为 FUSION 的新型人工智能系统来解决这个问题。FUSION 不仅仅孤立地观察突变,而是构建了一张关于蛋白质如何构建以及如何运动的详细地图。它将蛋白质的化学序列、折叠形状及其结构灵活性结合成一个统一的模型。通过对数千个案例进行训练,该系统学会了识别区分癌症致病驱动突变与无害乘客突变的细微结构特征。结果表明,这种方法可以识别出其他方法所遗漏的危险突变,包括那些并不出现在常见的“热点”(即癌症最常发生的位置)区域的罕见变异。这种能力提供了一种新的方式,可以优先筛选哪些遗传错误值得进一步研究,从而潜在地帮助医生了解患者肿瘤的独特生物学特性。

研究人员构建 FUSION 是为了处理人类蛋白质的复杂性,这些蛋白质是折叠成复杂三维形状的长链氨基酸。为此,他们向系统输入了三种不同类型的信息。首先,它使用一个在数百万个蛋白质序列上训练过的语言模型,以理解每个氨基酸的化学环境。其次,它结合了蛋白质的物理形状,该形状由一个充当“分子建筑师”的强大结构预测工具生成。第三,它包含了局部环境的细节,例如蛋白质的特定部分是一个刚性的螺旋结构还是一个灵活的环状结构。系统随后将这些部分连接成一个网络,其中每个氨基酸都是一个节点,而它们之间的物理距离则是连接。这使得 AI 能够看到一个位置的变化如何波及整个结构。

这项工作的一个关键创新在于,系统如何处理蛋白质并非静态雕塑这一事实——蛋白质会摇摆和移动。为了捕捉这种运动,研究人员使用了一种生成技术,创建了数千个略有不同的蛋白质结构版本,模拟分子的自然灵活性。他们利用这些变化来教导 AI 在运动状态下蛋白质看起来是什么样的,而不仅仅是处于一种冻结的姿态。然而,当系统对新患者进行最终预测时,它只需要一个最可能的结构。在许多运动部件上的训练只是帮助模型学习蛋白质行为的底层规则,使其在遇到新的、未见的突变时更加稳健。

团队在两个主要挑战上测试了 FUSION。首先,他们针对大量在实验室中经过实验验证确实会导致癌症的突变集对其进行了评估。在这些测试中,该系统以极高的准确率正确识别了驱动突变,表现优于现有方法。它特别擅长发现那些仅在大数据集中出现一次或两次的罕见变异,而这类变异往往会被依赖频率的工具所忽略。例如,系统正确地将名为 POT1 的基因中的一种罕见突变识别为驱动突变,这一发现与有关该基因在保护 DNA 方面作用的生物学证据相吻合,尽管该突变过于罕见,以至于其他方法无法将其标记出来。

研究人员还将 FUSION 特别应用于胰腺导管腺癌,这是一种致命的胰腺癌形式。在这种背景下,该系统实现了更高的准确度,在绝大多数情况下正确区分了驱动突变与乘客突变。它成功识别了 KRAS 和 TP53 等基因中的已知驱动突变,但也强调了其他此前尚未与该疾病建立联系的基因中的罕见突变。一个显著的发现是位于名为 SASH1 的基因中的突变。该突变位于蛋白质的一个灵活且无序的区域,远离癌症突变通常发现的热点区域。系统将其标记为潜在的驱动突变,进一步分析表明,该突变可能会破坏蛋白质停止肿瘤生长的能力,这一发现为胰腺癌的研究开辟了新途径。

除了做出预测之外,该系统还提供了一种解释其为何做出这些选择的方法。研究人员检查了模型的内部“注意力机制”,这显示了系统在做出决策时关注蛋白质的哪些部分。对于 KRAS 蛋白的一种常见突变,系统密切关注了已知对蛋白质功能至关重要的特定区域,包括那些与其他分子相互作用以控制细胞生长的区域。它还强调了突变位点附近的一个瞬态口袋(transient pocket),这是一个最近已成为新型癌症药物靶点的结构特征。这种指向具有生物学意义区域的能力表明,该系统不仅仅是基于数据模式进行猜测,而是真正学习了支配蛋白质运作的物理规则。

该研究表明,将不同类型的分子信息结合到单个基于图的模型中,可以显著提高检测癌症驱动突变的能力。通过超越简单的突变列表,转而将蛋白质建模为一个动态的、互连的结构,FUSION 提供了一个关于遗传错误如何导致疾病的更完整的图景。虽然该系统本身并不是一种疗法,但它作为一个强大的工具,可以帮助从现代测序产生的海量遗传数据中进行筛选。它帮助研究人员和临床医生将注意力集中在最有可能是驱动癌症的突变上,为更具针对性的治疗方案和对疾病更深入的理解铺平道路。这项工作表明,精准肿瘤学的未来在于能够解读生命复杂的、三维语言的工具,将原始的遗传数据转化为可操作的生物学洞察。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →