← 最新论文
🧬 biology

Machine-Readable Database for Genotype-Phenotype Analyses in Rare Diseases Using FKTN-related Congenital Muscular Dystrophies as a Prototype

本文介绍了一个汇集了已发表的 FKTN 相关先天性肌营养不良文献的机器可读数据库,该数据库具有统一的基因型-表型数据和一个新的临床严重程度量表,旨在促进基因型-表型关联研究,并作为类似罕见病分析的试点。

原作者: Matthew E. Lefkowitz, Sofia G. Eisenberg, Ruili Huang, Uma S. Mudunuri, Robert Leaman, Zhiyong Lu, Svetlana Gorokhova, Sharie J. Haugabook, Elizabeth A. Ottinger, Ann R. Knebel, Donald C. Lo, Carsten
发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Matthew E. Lefkowitz, Sofia G. Eisenberg, Ruili Huang, Uma S. Mudunuri, Robert Leaman, Zhiyong Lu, Svetlana Gorokhova, Sharie J. Haugabook, Elizabeth A. Ottinger, Ann R. Knebel, Donald C. Lo, Carsten G. Bönnemann, A. Reghan Foley

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

技术摘要:用于 FKTN 相关先天性肌营养不良症基因型-表型分析的机器可读数据库

问题陈述
FKTN 相关先天性肌营养不良症(CMDs)代表了 α\alpha-神经节苷脂病中一个高度异质且极罕见的亚型。虽然 FKTN 基因是导致这些疾病的明确双等位基因原因,但临床文献却高度碎片化,分布在近 100 篇描述不同人群和多样化表型的论文中。目前,这些数据主要以非结构化文本的形式存在于病例报告和系列研究中,缺乏统一化处理。这种数据的缺失阻碍了预测遗传致病性、理解致病机制以及探索这些罕见疾病治疗机会的能力。现有的基因组数据库(如 ClinVar、LOVD)往往缺乏与特定基因型相关的详细、标准化的表型信息。

方法论
作者采用了一个严格的多阶段流水线,从文献中提取、统一并结构化数据:

  1. 文献识别与提取:

    • 通过使用与 FKTNfukutindystroglycanopathymuscular dystrophy 相关的术语,对 PubMed 进行迭代搜索(2022 年 1 月 – 2024 年 4 月),共识别出 288 篇稿件。
    • 在根据相关性和纳入标准进行筛选后,保留了 92 篇稿件,涵盖 749 名患者(包括 386 个个体病例报告/系列和 363 名分组患者)。
    • 数据被手动提取到一个按患者而非按稿件组织的电子表格(“目录”)中,以防止重复。提取的字段包括变异、性别、种族、发病年龄、四个器官系统(肌肉、神经、心脏、眼科)的临床表现以及治疗结果。
  2. 基因型统一化:

    • 变异被标准化为基因组参考联盟人类版本 38 (GRCh38/HG38) 格式。
    • 由于 NCBI 中存在 10 个不同的 FKTN 转录本异构体,且旧文献中经常缺乏异构体说明,作者使用包括 VariantValidator、Varsome、Mutalyzer 3 和 NCBI Nuccore 在内的工具,将变异与所有十个异构体进行了交叉引用。
    • 冲突通过优先考虑经过临床验证的数据库(LOVD、ClinVar)或根据论文细节重建原始位置来解决。
    • 数据被转换为标准的变异调用格式 (VCF),并对插入和缺失进行了特定修改。无法映射到特定变异的单倍型记法被排除在外。
  3. 表型统一化(NLP 流水线):

    • 自然语言临床描述通过 PhenoTagger 被转换为人类表型本体 (HPO) 术语。
    • 为了解决该工具无法检测否定语义的问题(例如,“无肌肉无力”被误识别为阳性表型),作者集成了 NegBio 并开发了自定义脚本。这些脚本利用否定词词典来过滤掉假阳性。
    • 这种结合的方法过滤了超过 90% 的非相关阳性信息,在经过人工策展以移除混杂变量(如类固醇诱导的症状)后,将最初的 505 个唯一 HPO 术语减少到了 341 个相关表型。
  4. 临床严重程度量表开发:

    • 基于患者一生中达到的最大运动里程碑,改编自改良版 Ueda 分类法,开发了一种新的临床严重程度量表。
    • 量表定义:
      • 1 (轻度): 实现独立行走。
      • 2 (中度): 实现独立坐立或站立。
      • 3 (重度): 从未实现独立坐立、站立或头部控制。
      • C: 年龄太小,无法确定里程碑。
      • X: 信息不足。
    • 同时针对神经系统、心脏和眼科病理的存在与否分配了二元指标。

关键结果

  • 数据集组成: 最终的机器可读数据集包含来自 92 篇稿件的 749 名患者。在排除“范围内的患者 (PIR)”以确保个体数据完整性后,分析聚焦于特定的患者记录。
  • 遗传学发现: 识别出 52 种独特的基因型组合。最普遍的是日本祖先奠基性变异(3-kb 逆转座子在 3' UTR 中的插入)。其他显著变异包括阿什肯纳兹奠基性变异 (c.1167dup) 以及土耳其人群的变异。
  • 表型分布:
    • 严重程度: 60 名患者被归类为轻度 (1),157 名为中度 (2),60 名为重度 (3)。11 名太年轻 (C),另一些人数据不足 (X)。
    • 器官系统: 肌肉相关症状影响了 337 名患者,神经系统 (CNS) 症状影响了 173 名,眼科症状影响了 57 名,心脏症状影响了 51 名。
  • NLP 性能: 集成 NegBio 和自定义脚本成功过滤了超过 90% 的非相关阳性信息,与仅使用 NegBio(约 60% 的过滤率)相比,显著提高了数据准确性。

意义与主张
本文展示了一种全面的 FKTN 相关 CMDs 文献提取与统一化方法,可作为其他罕见单基因疾病数据提取的试点。

  • 方法论蓝图: 作者将这项工作定位为其他罕见单基因疾病数据策展的“蓝图”。这种半自动化流水线(人工提取 + NLP 统一化 + 自定义过滤)旨在可复制于具有类似文献量(约 200 篇)的其他疾病。
  • FAIR 数据原则: 该数据集将非结构化的历史文献转化为 FAIR(可发现、可访问、可互操作、可重用)数据,允许其集成到更广泛的罕见病登记系统中。
  • 临床应用价值: 新开发的临床严重程度量表提供了一个标准化的度量指标来分类表型数据,从而促进基因型/表型相关性研究。
  • 未来自动化: 作者谦虚地指出,虽然目前的自动化受限于需要人工标记和复杂的变异统一化,但该数据集可作为控制组和训练场,用于未来通过大语言模型 (LLM) 实现全自动的文献提取与策展。

该工作由美国国家卫生研究院 (NIH) 内部研究计划支持,并通过 RARe-SOURCE® 数据库及相关的 GitHub 仓库公开。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →