← 最新论文
🧬 biology

Evaluating Deep Multivariate Imputation Models on Wearable Device Data

本文引入了一种新的评估与训练协议,该协议考虑了可穿戴设备数据中固有的结构化、块状缺失特性,证明了使模型与真实的缺失模式相匹配能显著提高性能,并揭示了没有任何单一的插补方法能在所有生理特征和缺口严重程度下都占据主导地位。

原作者: Skye Goodman, Roussel Desmond Nzoyem, Leandro Junges, Peter Kissack, Yasser Qureshi, Amberly Brigden, Jeff Clark, Nawid Keshtmand

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Skye Goodman, Roussel Desmond Nzoyem, Leandro Junges, Peter Kissack, Yasser Qureshi, Amberly Brigden, Jeff Clark, Nawid Keshtmand

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

像智能手表这样的可穿戴设备已经从简单的健身追踪器转变为强大的持续健康监测工具,为人们提供了一个曾经只能在医院才能获得的观察人体节律的窗口。这些小工具收集着源源不断的连续数据,如心率、睡眠阶段和运动,从而构建出一个人的生理状态的详细时间线。然而,这些数据很少是完美的。传感器可能会失去与皮肤的接触,电池可能会耗尽,或者连接可能会中断,从而导致时间线出现空白。当这些空白发生时,它们通常是成簇出现的;如果传感器失去接触,它会同时停止记录多个测量值,而不仅仅是偶尔跳过一个数字。为了理清这些不完整的信息,科学家们使用计算机模型来填补缺失的部分,这个过程被称为插补(imputation)。这些填补值的质量至关重要,因为它们是任何未来健康预测的基础,例如预测癫痫发作或检测感染。如果模型猜错了,基于此构建的整个健康分析都可能出现偏差。

多年来,研究人员一直使用一种假设数据缺失是随机发生的测试方法来测试这些填补模型,就像雨滴落在窗户上一样。他们会取一个完整的数据集,随机擦除一些点,然后观察模型是否能将它们猜回来。然而,这种方法无法反映可穿戴设备实际失效的方式。在现实世界中,当传感器掉线时,它通常会留下一个长期的、连续的空白,导致许多不同的测量值同时缺失。由斯凯·古德曼(Skye Goodman)及其来自布里斯托大学、曼彻斯特大学和伯明翰大学的研究人员开展的一项新研究挑战了这种旧的测试方式。通过分析一名佩戴 Garmin 智能手表的癫痫患者的数据,研究人员开发了一种新的测试协议,该协议模拟了这些真实的、成簇的空白。他们发现,标准的测试方法掩盖了模型的真实优缺点,并且仅仅通过改变模型的训练和测试方式,就能显著提高其性能。

研究人员首先研究了数据集中缺失数据的特定模式。他们发现,手表记录的九种不同健康指标并不是独立失效的。相反,它们与产生这些数据的硬件紧密相关。例如,心率、脉搏间隔和压力评分都依赖于手腕上的光学传感器。当该传感器失去接触时,所有这些测量值都会同时消失。相比之下,步数来自另一个传感器——加速度计,它有自己的失效模式。此外,空白的长度差异巨大;有些特征只有短暂的、瞬间的掉线,而另一些特征(如心率)则会遭受可能持续数小时的长时段中断。团队意识到,单一、统一的测试方法无法捕捉这种复杂性。他们创建了一个新的评估系统,从训练数据中挖掘这些真实的空白,按长度将其分为典型、中度和严重三个等级,然后将这些精确的模式注入到测试数据中。这确保了模型是在面对现实世界中那种困难的、成簇的缺失情况时接受测试。

当研究人员应用这种现实的协议时,结果令人震惊。他们测试了两种先进的深度学习模型,即 BRITS 和 SAITS,这些模型旨在处理复杂的序列数据。在旧的随机测试方法下,这些模型的表现看起来相当不错。然而,在针对现实的、成簇的空白进行测试时,它们的性能大幅下降,揭示了它们此前一直处于过度自信的状态。研究表明,这些模型是在数据缺失随机分布的情况下进行训练的,因此它们从未学会如何处理整块数据丢失的情况。为了解决这个问题,团队调整了训练过程,使模型在学习阶段也能接触到这种现实的、块状形式的缺失。这一简单的改变产生了深远的影响:在最严重的空白场景下,BRITS 模型的误差率下降了 43%。这并非微小的改进,而是将一个在现实条件下表现挣扎的模型,转化为了一个表现稳健的模型。

研究还表明,没有任何一个模型是全能的。研究人员发现,最佳方法完全取决于数据的特定类型和空白的长度。对于移动缓慢的特征,例如每日步数或变化非常缓慢的身体能量得分,一种被称为线性插值(linear interpolation)的经典简单方法(本质上是在最后一个已知点和下一个点之间画一条直线)通常是最准确的,尤其是在处理短间隙时。然而,对于动态、快速变化的信号(如心率),先进的深度学习模型则表现得更为优异,特别是在间隙较长的情况下。研究人员还发现,加入一天中的时间信息和身体自然日间节律的信息,有助于模型在数据缺失时做出更好的推测。这在 BRITS 模型上尤电为明显,在加入这些基于时间的线索后,其心率和睡眠数据的准确性得到了显著提升。

有趣的是,研究强调了准确性与数据形状之间的权衡。虽然其中一个模型(扩展版 BRITS)在猜测缺失点的精确数值方面表现更好,但另一个模型(SAITS)在保持数据整体统计形状方面更具优势。这种区别在医学应用中至关重要。一个可能在平均值上很准确的模型,可能会在捕捉罕见、极端事件方面失败,例如可能发生在癫痫发作前的突然心率飙升。研究人员发现,这两个模型都倾向于平滑掉这些极端值,这可能会掩盖医生需要看到的关键信号。这表明,尽管这些模型功能强大,但仍需进一步完善,以确保它们不会错过关键的、救命的异常情况。

这篇论文的研究结果为可穿戴健康技术的未来传递了一个明确的信息。我们测试模型的方式与模型本身同样重要。使用不切实际的随机测试方法会给人一种虚假的安全感,并掩盖技术的真实能力。通过采用能够反映传感器失效这种混乱且成簇的现实情况的协议,研究人员可以开发出更好的填补空白的策略。研究结论指出,不存在适用于所有情况的单一“最佳”模型;相反,最有效的方法可能是一个混合系统,能够根据具体任务选择合适的工具,无论是为缓慢数据提供一条简单的直线,还是为动态信号提供复杂的神经网络。这种从寻求通用解决方案转向理解数据细微差别的视角转变,是构建未来更可靠、更有效的健康监测系统的关键一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →