POME: Graph-based embeddings for partially observed mixed-type data
该论文介绍了 POME,这是一种旨在为部分观测的混合类型生物医学数据生成低维表示的自监督图嵌入模型,该模型实现了最先进的插补性能,并能有效支持下游任务,如患者亚组发现、预测建模和治疗推荐。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在现代医学的广袤领域中,数据是理解疾病并指导治疗的首要工具。医生和研究人员收集了大量关于患者的信息,从肿瘤中发现的特定细胞类型到血液检查结果以及既往病史。这些信息很少是统一的;它们是数字、类别和文本的混乱混合,通常被称为混合型数据。此外,这些数据几乎从来不是完整的。患者会错过预约,某些测试并未为每个人都进行,记录也会丢失,从而留下如同电子表格中空白空间般的缺口。几十年来,这些缺口和杂乱多样的数据类型迫使科学家要么丢弃不完整的记录,要么使用统计技巧来填补它们,这两者都会扭曲患者健康的真实图景,并导致错误的结论。
一组研究人员现在开发了一种处理这种混乱现实的新方法,将缺口和多样性转化为特征而非缺陷。他们创建了一个名为 POME 的工具,代表“部分观测到的混合型数据嵌入”(partially observed mixed-type data embeddings)。POME 并没有试图将所有不同类型的医学数据强行塞入单一、僵化的格式,也没有简单地删除缺失的部分,而是将整个数据集视为一张连接图。想象一个网络,其中患者是一组点,而关于他们的每一项可能的信息是另一组点。当一名患者有血液检查结果时,一条线会将他们与该结果连接起来。当某项数据缺失时,这条线就仅仅没有被画出来。这种方法使计算机能够学习患者与症状之间的关系,即使在数据不完整且杂乱无章的情况下也是如此。
研究人员在涉及数千名肺癌、头颈癌及其他接受化疗治疗的患者的三个大型真实世界医疗记录集上测试了这种方法。他们发现,POME 填充缺失信息的能力达到了与现有最佳方法相匹配甚至超越的水平。更重要的是,该工具为每位患者创建了一种新型的“指纹”。这些指纹不仅仅是简单的摘要,而是捕捉了患者多样化健康指标之间复杂相互作用的丰富、低维表示。当研究人员在没有告知计算机寻找目标的情况下,利用这些指纹对患者进行分组时,形成的群体具有医学意义。例如,该工具自然地根据肿瘤是否与特定病毒相关(这是一个已知会影响生存率的因素)对患者进行了区分,或者根据肿瘤中免疫细胞的密度(这是身体对抗疾病的一种迹象)对患者进行了分组。
这些指纹的力量不仅限于对患者进行分类。研究人员利用它们回顾了历史治疗决策,并观察这些决策是否合理。通过将新患者的指纹与过去患者的指纹进行比较,系统可以建议对于相似个体而言,哪种治疗策略在过去效果最好。在一次涉及头颈癌患者的测试中,那些实际接受的治疗与基于这些指纹的系统推荐相匹配的患者,其五年生存率明显高于治疗与推荐不匹配的患者。这表明,该工具可以识别症状和病史的不同组合如何对特定疗法产生反应的微妙模式,从而为医生提供支持,帮助其做出更明智的选择。
研究还表明,这些指纹可以用于预测未来的结果,例如患者是否会产生特定的化疗副作用,其表现通常优于处理混合数据的其他标准方法。研究人员甚至深入观察了该工具内部,以了解它对变量本身学到了什么。他们发现,该工具正确地将生物学相关的医学术语(例如不同类型的白细胞)归为一类,这证明它学习到了医学数据的底层逻辑,而不仅仅是记忆数字。
虽然该工具目前针对强大的计算机硬件进行了优化,并且在处理极大型数据集时需要大量的内存,但研究人员已经证明其运行速度足以在现实世界的流程中使用。他们已向公众开放了该软件,以便其他科学家可以在自己的数据上进行测试。这项工作并不声称解决了医学数据分析中的所有问题,但它提供了一种稳健的新方法,将临床实践中混乱、不完整且多样的记录转化为清晰、可操作的洞察。通过尊重数据的自然结构(包括其缺失部分),POME 使研究人员能够更清晰地观察患者,从而有望实现更准确的诊断和更有效的治疗。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。