← 最新论文
📊 statistics

A New Trained Supervised Method for Calculating Patient Similarity

本文提出了一种新的监督患者相似性度量方法,该方法采用带有松弛自适应组 Lasso 权重的加权余弦相似度,尽管在校准方面存在轻微权衡,但显著提高了针对二元健康结局的个性化模型的判别能力和整体预测准确性。

原作者: Minzee Kim, Joel A. Dubin

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Minzee Kim, Joel A. Dubin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代医学领域,海量的数字化病历记录正变得触手可及,为预测健康结局提供了宝贵的信息库。传统上,医生和数据科学家会构建一个单一且通用的模型,来预测特定疾病可能如何进展。这种方法将每位患者都视为庞大且混合群体中的一部分,假设整个群体的平均经验适用于个人。然而,个性化医疗领域中一个日益增长的学派认为,这种“一刀切”的策略未能达到预期目标。相反,它提出,针对特定个人的最佳预测,来自于对那些与该个体最为相似的人群的研究。因此,挑战不仅在于拥有数据,更在于当两个人在年龄、性别到复杂且波动的生命体征等方面存在数十种差异时,究竟该如何衡量两人之间的“相似性”。

滑铁卢大学的一个研究小组通过开发一种计算两名患者相似度的新方法,解决了这一问题。他们的工作聚焦于一种被称为“个性化预测建模”的方法,即利用训练数据中一小组定制的相似患者,为每个个体构建一个独特的预测模型。其创新的核心是一个用于衡量相似性的新数学工具。以往的方法通常将每一项患者信息视为同等重要,或者依赖专家来决定哪些因素更为关键,而这种新方法则让数据本身来决定。研究人员创建了一个系统,能够根据每一项患者信息(如血压读数或诊断结果)在预测特定结果时的实际强度,为其分配一个特定的重要性评分。他们使用了一种复杂的统计技术来过滤噪声并突出信号,有效地教会了计算机在比较两人时,哪些细节需要加重权重,哪些需要忽略。

研究人员通过创建数千份具有已知结局(涵盖从低风险到高风险场景)的模拟患者记录来测试这种新方法,并应用其算法以观察它是否能找到正确的匹配对象。他们将这种新的加权方法与旧的标准相似性衡量方法(例如将所有数据点视为同等对待的简单距离计算)进行了对比。结果显示,这种新方法在区分具有不同结局的患者方面(即所谓的“判别力”)表现得显著更好。在许多测试中,新方法正确识别出了最相似的患者,从而使模型能够做出更敏锐、更准确的预测。有趣的是,虽然新方法有时会让预测结果在精确概率的校准上稍逊一筹,但其在区分患者差异方面的巨大进步意味着整体预测准确度更高。在一项具有中等信号强度的特定模拟实验中,最好的结果来自于仅使用最相似的前 20% 患者进行模型训练,而非使用整个数据集。

为了验证其在现实世界中的表现,该团队将此方法应用于一个包含美国超过 20 万次住院记录的大型真实世界重症监护室数据库。他们专注于预测患者能否在住院期间存活,使用的信息包括人口统计学数据以及前 24 小时内复杂的连续生命体征测量值(如心率和血氧水平)。正如在模拟实验中所见,这种新的加权方法优于标准方法。当研究人员使用这一新工具为特定个体挑选出最相似的 20% 患者进行模型训练时,所得出的预测结果比使用标准方法或整个数据集得到的预测更加准确。这项研究表明,通过让数据决定哪些特征更为重要,而不是依赖固定规则或专家猜测,医疗模型可以变得更加精准。研究人员指出,尽管他们的方法展现出了巨大的潜力,但其在底层数据信号较强时最为有效,并计划在未来探索这些技术如何与更复杂的机器学习模型相结合。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →