GeneResolver: A Traceable Hybrid Multi-Agent Pipeline for Etiology-Aware Gene Prioritization
GeneResolver 是一个具有可追溯性、面向隐私的混合多智能体流水线,它通过首先对病例病因进行分类以进行适当的证据路由,从而改进了罕见病诊断,并在仅表型和表型-基因组结合的基准测试中均优于现有工具。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
对于在罕见遗传病迷宫中穿行的家庭来说,通往诊断的道路往往是一段漫长而疲惫的旅程。即便拥有可以读取一个人完整遗传密码的现代技术,寻找导致疾病的特定错误仍然十分困难。挑战不仅在于读取代码,更在于理解其含义。医生必须从数以千计的遗传变异中进行筛选,寻找与患者独特症状集相匹配的那一个。这一过程高度依赖于对这些症状的精确描述,而这些描述通常会被转化为一份标准化的医学术语列表。然而,将医生凌乱的手写笔记或复杂的患者病史故事转化为那份整洁、标准化的列表,是一项缓慢且需要人工完成的任务。此外,许多用于寻找疾病原因的工具都假设问题源于单个损坏的基因。如果疾病实际上是由大规模染色体错误、许多微小遗传因素的混合,或完全在基因之外的因素引起的,这种假设可能会误导医生走上错误的道路。
由北马其顿研究人员开发的一个名为 GeneResolver 的新系统,试图通过扮演一名智能且注重隐私的医生向导来解决这些问题。该系统并非直接跳到对基因进行排名,而是首先阅读患者的故事,以决定它正在面对哪种类型的生物学问题。它提出了一个简单但至关重要的问题:这很可能是由单个基因引起的,还是由其他因素引起的?如果答案是单个基因,系统就会继续对潜在的遗传罪魁祸首进行排名。如果答案是其他情况,系统则会停止基因搜索,转而提供有关实际原因的证据,例如染色体问题或非遗传因素。该系统旨在在医院自己的计算机上本地运行,确保敏感的患者故事和遗传数据永远不会离开建筑内部,这是保护隐私的一项关键特性。
研究人员将这个系统构建为一组协同工作的专业数字助手团队。其中一个助手负责阅读原始临床笔记,并仔细删除任何个人细节(如姓名或地址),用通用的占位符取而代代之。另一个助手负责将剩余的医疗故事转化为使用标准医学词汇的结构化症状列表。第三个助手会在遗传数据可用时查看这些数据,检查遗传代码中的错误。随后,一个中央协调器会获取所有这些信息并对疾病类型做出判断。如果系统判定该病例符合单基因模式,它就会进入排名阶段,将症状与已知的遗传关联以及发现的任何遗传错误的严重程度进行权衡。如果系统判定该病例不是单基因疾病,它会将信息路由到另一个分支,收集与该特定问题类型相关的证据,从而避免强行将单基因解释套用于复杂病例的错误。
在测试这种方法时,研究人员发现该系统能够高精度地区分单基因病例和其他类型的疾病。当被要求在没有任何先验示例学习的情况下对原始患者故事进行分类时,系统正确识别出疾病类型的比例为 77%。更重要的是,它在 86% 的情况下能正确地将单基因病例与其他类型病例区分开来。这种正确路由病例的能力至关重要,因为它能防止系统在基因搜索并非正确工具时浪费时间或给出误导性的结果。当单基因是可能的原因时,该系统在核心任务——即寻找正确的基因方面也表现出色。在一个包含近 4,700 个仅有症状描述病例的大型数据集中,该系统将正确基因排在首位的频率高于其他广泛使用的工具。当加入遗传数据后,系统的寻基因能力进一步提升,在超过一半的病例中将正确答案排在了首位。
研究还强调了保护数据隐私的重要性。该系统使用大型语言模型来理解医疗故事的语境,但该模型完全在医院的本地硬件上运行。这意味着患者生活和健康的敏感细节永远不会被发送到外部服务器。研究人员测试了不同的清理笔记中个人信息的方法,并发现一种特定的本地工具在保持医疗含义完整的同时,在删除身份识别细节方面最为有效。通过将这种本地隐私保护与适应疾病类型的灵活工作流相结合,GeneResolver 提供了一种应对罕见疾病的新方法。它并不声称要取代医生;相反,它作为一个可追溯、基于证据的伙伴,负责组织复杂的信息并建议最可能的路径,而将最终的决策和解释留给人类专家。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。