MolBioKG: Grounding Out-of-Graph Molecules in Biomedical Knowledge Graphs via Multi-Resolution Structural Anchoring
MolBioKG 通过引入一个两层系统,通过多分辨率结构锚定和自适应大语言模型驱动的遍历,将图外 SMILES 字符串接地到大规模知识图中,从而解决了生物医学药物发现中未注册分子的冷启动挑战,在无需特定任务训练的情况下,显著提高了推理准确性和靶点召回率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一座宏大的、活生生的图书馆,其中的每一本书都是一段生物学知识:某种特定药物如何对抗某种疾病,某种蛋白质如何与基因相互作用,或者为什么某种特定的化学结构会引起副作用。科学家们称之为“生物医学知识图谱”(Biomedical Knowledge Graph)。它就像一个巨大的、互联互通的事实网络,帮助计算机寻找治愈疾病的新方法。但问题在于,这座图书馆里的书仅限于那些已经被登记并编入目录的分子。如果一位科学家今天发明了一种全新的分子——一种前所未见的分子——图书馆里就没有它的记录。它是系统中的一个“幽灵”。计算机无法阅读这个幽灵的故事,因为这个幽灵还没有办理图书证。这是一个巨大的问题,因为新药被发明的速度快于图书管理员更新书架的速度。如果我们无法将这些新的、未注册的分子连接到现有的知识网络中,我们可能会错过救命的疗法或忽视危险的副作用。大问题在于:如何在没有正式介绍的情况下,将一位陌生人引入一个专家云集的房间?
这正是 MolBioKG 这篇论文试图解决的问题。来自东京大学和 SB Intuitions 的作者团队构建了一个巧妙的双层系统,它充当了“大师级翻译官”和“侦探”的角色。MolBioKG 不再等待新分子办理图书证,而是观察它的“DNA”——即它的化学结构——并寻找那些已经拥有图书证的“亲戚”。
把一个新分子想象成一个穿着独特服饰走进派对的人。即使你从未见过他们,你也可能注意到他们戴着和某位著名演员风格相同的帽子,穿着和某位摇滚明星一样的鞋子,或者提着一个和科学家类似的包。MolBioKG 通过将新分子分解为四种不同的“装扮”或视角来实现这一点:它的主骨架(scaffold)、它的微小构建模块(fragments)、它的化学配件(functional groups)以及它的整体指纹(fingerprint)。然后,它会在图书馆中搜索具有这些特征的现有分子。
一旦它找到了这些“亲戚”,系统不仅仅是进行猜测;它还会追踪它们的联系。如果这个新分子看起来像是一种治疗帕金森病的药物,系统就会建议它可能也能治疗帕金森病,但它会保留一条清晰的路径,展示其做出这一判断的原因。论文通过三种方式测试了这个系统:
- “隐藏链接”测试: 他们在图书馆中隐藏了已知的联系,并询问 MolBioKG 是否能再次找到它们。它的表现优于之前的最佳系统,尤其是在寻找广泛可能的疗法方面。
- “复杂谜题”测试: 他们要求系统回答复杂的、多步骤的问题,例如:“哪些疾病是由针对这种特定蛋白质的药物治疗的?”在这里,他们使用了一个名为 Adapt-KG 的智能 AI 代理,它可以决定追踪哪些线索,就像侦探破解谜团一样。这种方法将系统解决这些谜题的能力从 58.5% 提升到了 87.6% 的准确率。
- “全新药物”测试: 这是真正的“冷启动”挑战。他们选取了 2011 年之后获批的 199 种药物(当时图书馆并不知晓这些药物),并要求 MolBioKG 预测它们的用途。通过使用其多视角的侦探工作,该系统正确识别新靶点的能力比没有任何帮助的盲猜提高了两倍。
论文认为,你不能只依赖一种观察分子的方式。有时主骨架是关键;有时一个微小的片段或一个特定的化学基团才讲述了整个故事。通过将所有这些视角融合在一起,MolBioKG 创建了一条从新的、未知的分子到广阔已知医学事实的“可追溯”路径。它不仅给出一个答案,还向你展示证据,确保每一个预测都植根于真实的、现有的生物学数据。作者指出,这种方法是药物研发未来的强大工具,它能将孤立的、未知的化学结构转化为与新疗法相关的、可追溯的候选对象。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。