← 最新论文
🧬 biology

XG-PUL: A Network-Based Framework for Disease Gene Prioritization Using Graph Representation Learning and Positive-Unlabeled Learning

该论文提出了 XG-PUL,这是一个鲁棒的机器学习框架,它结合了基于 Node2Vec 的图表示学习与基于 Bagging 的正样本-无标签(positive-unlabeled)分类器,通过解决生物网络中标签不确定性的挑战,来有效地对疾病相关基因进行优先级排序。

原作者: Mahdiyeh Ayouman, Zahra Narimani

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Mahdiyeh Ayouman, Zahra Narimani

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,人体就像一座规模宏大、繁忙喧嚣的城市。在这座城市里,每一个基因都是一名公民,而他们制造的蛋白质则是他们相互交流时使用的工具和信息。这些对话构成了一个巨大的连接网络,被称为“蛋白质-蛋白质相互作用网络”。有时,少数公民生病了,他们的不良习惯在城市中蔓延,导致了疾病。科学家们将这些患病的集群称为“疾病模块”。巨大的挑战在于:我们只知道少数几个“坏苹果”(已证实的疾病基因),却完全不知道其他捣蛋鬼是谁。城市的其余人口仅仅是一个庞大的、未标记的人群。如果我们试图通过假设其他人都是健康的来猜测谁生病了,我们可能会出错,因为其中一些所谓的“健康”人士实际上已经生病,只是尚未被发现。这就是寻找疾病基因时的棘手谜题:当你不确定谁是好人时,该如何找到那些隐藏的捣蛋鬼?

这正是名为 XG-PUL 的新工具发挥作用的地方,它扮演着城市网络中超级聪明侦探的角色。研究人员 Mahdiyeh Ayouman 和 Zahra Narimani 构建了一个计算机框架来解决这个特定的问题。他们没有去猜测谁是健康的,而是使用了一种被称为“正向-无标签学习”(Positive-Unlabeled learning)的巧妙策略。把它想象成一场“热与冷”的游戏:你知道宝藏在哪里(已证实的疾病基因),你也有一张城市地图(蛋白质网络),但你不知道其他的宝藏藏在哪里。XG-PUL 首先仅通过观察每个公民的社交圈及其在城市中的中心地位,就能学习每个人的“个性”,而无需预先知道他们是健康的还是生病的。然后,它利用一个侦探团队(一个分类器集成系统)对谁最可能是患病集群的一部分进行投票。通过让许多侦探观察略有不同的群体并对他们的投票取平均值,该系统变得非常擅长识别那些隐藏的捣蛋鬼,即使有些人正在伪装成健康人。

该团队在包括乳腺癌、精神分裂症和肝硬化在内的十种不同复杂疾病上测试了这个侦探。他们将 XG-PUL 与多年来一直使用的其他著名方法进行了对比。结果令人振奋:XG-PUL 在将最可能的疾病基因排在列表顶端方面表现得更好。例如,在寻找与乳腺癌相关的基因时,该系统成功地将已知且具有生物学重要性的基因放在了非常靠前的位置,证明了它并非只是在随机猜测。它还发现了参与特定通路(如控制细胞间通讯或免疫系统防御机制的通路)的基因。

然而,论文谨慎地指出,这并不是解决一切问题的万灵药。作者指出,他们的方法依赖于目前的“城市地图”,而这些地图仍然是不完整的。如果地图丢失了整个街区,侦探就无法找到躲藏在那里的捣蛋鬼。此外,当前版本将城市作为一个整体来看待,而不是检查特定的街区(例如仅仅是脑部或仅仅是肝脏),这可能会错过一些非常具体的细节。但就目前而言,XG-PUL 表明,通过将聪明的城市地图阅读方式与团队投票系统相结合,我们可以找到关于复杂疾病成因的新线索,从而帮助科学家将现实世界的实验重点放在最有希望的嫌疑人身上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →