← 最新论文
📄 genetic and genomic medicine

Making Accelerating Medicines Partnership Data Findable and Interoperable through a Common Data Model: Extending OMOP for Multi-Source Multimodal Data

本文描述了 SysBio 通用数据模型的设计、实现以及 AI 辅助的协调工作流,该模型扩展了 OMOP 框架,旨在实现加速药物研发伙伴关系(AMP)内多模态组学数据在联邦数据生态系统中的可发现性和互操作性。

原作者: Tindall, C., Long, R. A., Naughton, B., Mapes, B. M., Vismer, D., Skinner, H. G., Malenfant, J., Maurya, M. R., Nalls, M. A., Ramachandran, S., Nguyen, T., Peters, M. A., Scheuermann, R. H.

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Tindall, C., Long, R. A., Naughton, B., Mapes, B. M., Vismer, D., Skinner, H. G., Malenfant, J., Maurya, M. R., Nalls, M. A., Ramachandran, S., Nguyen, T., Peters, M. A., Scheuermann, R. H.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

现代医学的发展日益受到读取我们细胞内分子指令能力的驱动。科学家现在可以同时测量数以千计的这些指令,从而创建描述健康人群以及阿尔茨海默病或糖尿病患者基因行为的大规模数据库。这些被称为“组学”(omics)的数据,为观察人体内部运作机制提供了一个强大的窗口。然而,一个显著的问题已经出现:虽然数据确实存在,但它们是分散的。不同的研究项目以不同的数字格式存储其发现,使用各自独特的标签和归档系统。这就像是城市里的每座图书馆都使用不同的语言来编目书籍,使得研究人员几乎无法走进图书馆并提出一个需要同时阅读多个书架的问题。这种碎片化阻碍了科学家观察大局,例如在一种疾病中发现的生物学模式是否也出现在另一种疾病中。

为了解决这个问题,来自加速药物研发伙伴关系(Accelerating Medicines Partnership,一个由政府机构与私营公司组成的协作组织)的研究团队致力于构建一个用于处理这种复杂生物数据的通用归档系统。他们并没有从头开始发明一种新语言,因为那会对科学界而言既缓慢又难以采用。相反,他们采用了现有的、被广泛用于组织临床健康记录的系统,并对其进行了精心的扩展,以处理分子数据的独特需求。这个被称为 SysBio 通用数据模型(SysBio Common Data Model)的新框架,充当了一个翻译器,允许来自不同来源的数据进行并排比较,而无需强制原始数据所有者更改其文件存储方式。该团队通过成功映射来自四个不同疾病项目的数据,证明了这种方法是行之有效的,证明了研究人员现在可以使用统一的查询语句,跨越不同的疾病和组织进行广泛提问。

这项工作的核心在于在灵活性与结构性之间进行了一次巧妙的折衷。研究人员始于观测性医疗结果伙伴关系(Observational Medical Outcomes Partnership)模型,这是一个已被全球数千名研究人员信任、用于组织诊断、药物和住院就诊等患者记录的标准系统。虽然该系统在临床历史方面表现出色,但它缺乏描述分子实验是如何进行以及生成的数字文件存储在何处的特定工具。为了在不破坏现有系统的前提下解决这一问题,团队在数据库结构中仅增加了四个新表。这些新部分充当了记录实验室测试细节(如所使用的机器类型或遵循的具体方案)以及指向原始数据所在实际数字文件的专门文件夹。通过标准连接将这些新文件夹与现有的患者记录相连,该模型在增加分子分析所需上下文的同时,保留了原始临床数据的完整性。

这种设计选择是深思熟熟虑且务实的。研究人员使用涵盖四个主要疾病领域(包括阿尔茨海默病、帕金森病和自身免疫性疾病)的 11 个不同数据集对新模型进行了测试。这些数据集来源迥异,包含来自脑组织、血液和尿液的信息,且收集自患者生前及死后。尽管存在这些差异,新模型仍成功地将它们纳入了一个统一的共享结构中。其结果是,科学家可以提出一个复杂的问题,例如“查找来自狼疮患者肾脏样本的所有基因活动文件”,计算机便可以追踪从患者诊断到特定组织样本,再到实验室测试,最后到数字文件的路径,而无需了解生成数据的原始项目所具有的独特特征。

使该系统发挥作用的关键部分是确保用于描述数据的词汇在任何地方的含义都是一致的。在过去,一个项目可能会将某种特定的疾病阶段称为“3 期”,而另一个项目可能称之为“C 级”,这在尝试合并其结果时会导致混乱。为了防止这种情况,团队创建了一个中央注册表,充当字典的角色,精确定义每个术语的含义及其记录方式。他们使用了一种结合人工智能与人类专家的工作流,将来自原始项目的杂乱、多变的术语映射到这些清晰、标准的定义上。AI 提出连接建议,人类专家则进行审查以确保准确性,从而在旧有的、孤立的数据与新的、统一的模型之间建立起可靠的桥梁。这一过程确保了当研究人员查看来自两项不同研究的数据时,他们进行的确实是同类对比。

该项目的成功表明,大规模的科学协作可以在不需要每个参与者放弃其现有方法的情况下向前推进。该模型并不要求数据托管方移动其文件或重新格式化其数据库;相反,它提供了一个位于现有数据之上的组织层,使其对他人而言是可查找且可用的。研究人员展示了这种方法如何处理现代生物学的复杂性,从所使用的特定组织类型到生成数据的不同机器。虽然当前版本侧重于特定的分子测试,但其设计具备成长性。团队已经勾勒出一条路径,通过向现有框架中添加更多具体细节,即可加入新的数据类型,如空间成像或不同的化学测量。

最终,这项工作改变了科学家探索不同疾病之间联系的方式。通过将一个困难的集成项目转化为一个简单的搜索查询,新模型消除了发现的主要障碍。它允许研究人员在先前被隔离研究的条件下寻找共同的生物学特征,这可能揭示出有助于治疗多种不同疾病患者的新靶点。该系统保持着足够的灵活性以适应新兴技术,确保不断增长的生物医学数据能够发挥其全部潜力。研究人员已将其蓝图和使用工具向公众开放,邀请更广泛的科学界在此基础上继续开展工作,让复杂的生物数据对每个人都变得触手可及。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →