KRAKEN: A provenance-tracked knowledge graph for multiomic and wellness research
KRAKEN 是一个可扩展、具有溯源追踪功能的知识图谱,旨在通过将多样化的生物医学来源整合进一个拥有标准化语义、内置分析工具以及面向人类和人工智能驱动研究的多模态接口的模块化 1500 万节点系统中,来解决多组学和健康数据代表性不足的问题。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在现代生物学的广阔版图中,科学家们长期以来一直试图寻找一种方法,将我们细胞的微观机制与人类健康的宏观图景联系起来。几十年来,研究重点一直集中在理解疾病如何发生以及如何重新利用现有药物来对抗疾病。这种方法构建了强大的生物学关系图谱,但这些图谱往往忽略了那些更安静、更日常的健康层面。它们经常遗漏我们代谢中详细的化学特征、影响我们性状的特定遗传标记,以及定义我们的身体感受到的年龄与实际年龄之间复杂关系的各类数据。如果缺乏一个包含这些以健康为核心细节的完整图景,就很难看清我们的生物学在健康状态下(而不仅仅是在患病时)是如何运作的全貌。
一个名为 KRAKEN 的新项目旨在填补这一空白,通过创建一个巨大的、互联的图谱,架起疾病研究与普遍健康之间的桥梁。这项工作的研究人员意识到,虽然现有的图谱在寻找疗法方面表现出色,但在理解“完整的人”方面却是不完整的。为了解决这个问题,他们构建了一个系统,从许多不同的来源收集信息,包括脂质、遗传评分和标准化健康测量等专业数据库。这张新图谱不仅仅是列出事实;它将这些事实联系在一起,使得计算机能够追踪不同类型数据之间的联系,从我们血液中的分子到我们 DNA 中的遗传密码。其结果是一个工具,帮助研究人员和临床医生观察健康与福祉的各种因素是如何相关的,从而提供比以往任何单一统一系统都更全面的生命科学整体视角。
这一成就的核心是一个作为多样化生物信息中心枢纽的知识图谱。团队将来自几个大型现有网络的数据与专注于健康的专门来源(如多基因评分目录和生物年龄测量指标)结合在一起。通过将这些线索编织在一起,他们创建了一个包含约 1500 万个节点(代表单个信息片段)和约 1.13 亿条边(代表它们之间的关系)的结构。该网络涵盖了 62 种不同类型的实体,范围从特定的化学物质和基因到更广泛的健康概念。为了确保这组庞大的数据使用统一的语言进行交流,研究人员使用了一种符合美国国家卫生研究院(NIH)使生物医学数据更易于共享和理解之宏大目标的标准语义模型。
该系统的实用之处在于其灵活性和效率。研究人员开发了一种轻量级的构建过程,可以在标准计算硬件上运行,其内存峰值需求低于 48 GB。这种设计允许用户快速重建整个图谱,或者仅选择与其特定研究领域相关的数据部分。无论科学家是在研究特定的代谢途径,还是在观察广泛的健康趋势,系统都可以根据其领域进行定制,而无需处理整个数据集。这种模块化设计确保了该工具对于广泛的研究问题保持易用性和实用性,而不是一个静态且笨重的档案库。
除了单纯存储信息外,KRAKEN 还包含了一套旨在帮助用户探索数据的工具。这些工具支持“多跳推理”(multi-hop reasoning),这意味着系统可以沿着连接链寻找两个看似无关的概念之间的间接关系。用户还可以使用文本、向量或两者的结合进行搜索,以在图中找到特定的实体或模式。该平台还支持富集分析,有助于识别某些数据组是否比预期更有可能一起出现。所有这些功能都可以通过交互式 Web 界面和标准应用程序编程接口(API)进行访问,使数据能够同时为人类研究人员和自动化系统所使用。
该项目还引入了一个模型上下文协议(Model Context Protocol)服务器,这一特性允许人工智能代理和大型语言模型直接与该图谱进行交互。这种能力使这些先进系统能够直接消费结构化数据,并利用这些数据回答复杂问题或生成见解,而无需针对特定数据集进行重新训练。通过以这种方式开放数据,研究人员正在为新型自动化分析打开大门,这些分析可以利用图中包含的健康与多组学信息的全部深度。整个系统向公众免费开放,任何人只要有互联网连接,都可以探索这些联系,并为人类健康与福祉不断增长的理解做出贡献。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。