想象一下,你拥有一款智能手表,它能记录你的每一个动作:当你行走、静坐、睡眠或锻炼时,它都会捕捉到随之而来的晃动与颤动。这些数据只是一团混乱的数字流。若要了解你全天究竟做了什么,就需要一个“翻译器”,将这些数字转化为“睡眠”、“静坐”、“行走”或“跑步”等简单标签。
本文介绍了一种新的开源翻译器,名为ActiNet。它声称比目前使用的翻译器更智能。
以下是论文如何用简单的类比来解释这一点的:
问题所在:旧翻译器与新翻译器
多年来,研究人员一直使用一种基于“随机森林”模型的工具来翻译手表数据。可以将这个旧工具想象成一本规则手册。它会观察你手臂的晃动,然后说:“如果晃动强度如此,你肯定在坐着;如果更强,你肯定在行走。”它还算不错,但依赖于预先写好的规则。
作者构建了ActiNet,使其与众不同。ActiNet 不像是在遵循规则手册,而更像是一个在见到你具体的手表数据之前,已经观看了数百万小时视频的学生。
- 自监督学习:在针对真实人类进行测试之前,ActiNet 曾在海量未标记的运动数据(来自英国生物样本库)上进行训练。它自学识别模式,例如学会区分正向播放的视频与倒放的视频。这赋予了它对运动深刻而直观的“感觉”,而不仅仅是遵循僵化的规则。
- “编辑”(HMM):一旦 ActiNet 对每 30 秒内你在做什么做出猜测,它会将该猜测传递给一个名为隐马尔可夫模型(HMM)的“编辑”。如果 ActiNet 突然说:“你睡了 5 秒,然后跑步,接着又睡了”,编辑就知道这不太可能。它会理顺这个“故事”,确保除非确实合理,否则你不会每隔几秒就在“睡眠”和“跑步”之间反复跳跃。
大考:谁答对了?
研究人员使用151 名真实佩戴手表一整天的人的数据,对旧规则手册(随机森林)和新学生(ActiNet)进行了测试。由于这些人还佩戴了摄像机并记录了睡眠日记,研究人员确切知道他们在做什么,因此“真相”是已知的。
结果:
- ActiNet 获胜。 它正确识别人们行为的时间比例约为82%(称为“宏观 F1 分数”),而旧工具仅为76%。
- 表现一致。 ActiNet 不仅平均表现更好,而且对所有人都更有效,无论其年龄、性别如何。
- “轻度”活动差距:旧工具难以区分“静坐”与“站立/慢走”(轻度活动)。ActiNet 在捕捉这些细微运动方面表现更佳,正确识别率约为85%,而旧工具仅为73%。
它会改变你全天的“故事”吗?
研究人员还问道:“如果我们使用这个新工具,是否会改变我们估算的人们睡眠或锻炼的总时长?”
- 是的,但结果是更好的。 新工具预测的睡眠和静坐时间比旧工具更接近真实情况。
- 更少的“噪音”:旧工具有时会混淆,在你实际站立时说你坐着,反之亦然。ActiNet 减少了这类错误,意味着一个人全天活动的总“故事”更加准确。
不足之处(局限性)
论文诚实地指出了缺点:
- “黑箱”:由于 ActiNet 是自学成才,与旧规则手册相比,更难解释它为何做出特定决策。这就像一位能做出美味佳肴却难以解释食谱的厨师。
- 重负荷:训练该模型需要强大的计算机(GPU)和比简单规则手册更多的能源,尽管作者指出,由于模型是预训练的,后续使用它是高效的。
- 数据来源:该模型是在英国牛津的人身上训练的。虽然它表现良好,但作者承认,我们尚不确定它是否同样完美地适用于不同文化或环境的人群。
结论
论文总结道,ActiNet 是目前我们拥有的更好的手腕手表数据翻译器。它更准确,尤其是在捕捉像轻步行这样棘手的“中间”活动方面。由于它是开源的(任何人都可免费使用),作者认为科学家们应开始使用它,以更清晰地了解身体活动如何影响我们的健康。
以下是论文《ActiNet:一种基于自监督深度学习的腕戴式加速度计活动强度分类开源工具》的详细技术总结。
1. 问题陈述
大规模流行病学研究依赖于准确、开源的人类活动识别(HAR)模型,以分析腕戴式加速度计数据,并将体力活动与健康结果联系起来。传统上,这些研究使用随机森林(RF)分类器结合隐马尔可夫模型(HMM)进行平滑处理(例如 accelerometer Python 包)。虽然这些模型行之有效,但它们依赖于手工制作的特征,可能无法完全捕捉自由生活状态下运动的复杂性。
尽管自监督学习(SSL)和深度学习(特别是 HARNet)在提高 HAR 精度方面显示出前景,但此前尚不清楚:
- 基于 HARNet 并结合 HMM 平滑的模型,其表现与既定的随机森林基线相比如何。
- 此类模型是否会在不同人口统计学亚组(年龄、性别)中引入偏差。
- 分类性能的变化如何影响估计的每日活动强度构成(睡眠、久坐、轻度、中高强度)。
2. 方法论
数据集
- 主要数据: 本研究利用了 CAPTURE-24 数据集,这是目前最大的公开可用腕戴式加速度计标注数据集。该数据集包含 151 名参与者(年龄 18–91 岁,平均 42 岁,66% 为女性)佩戴 AX3 设备约 24 小时、采样率为 100Hz 的数据。
- 真实标签: 标注源自睡眠日记和 OMG Life Autographer 相机(每 20–40 秒捕捉一次图像),并根据 Walmsley 映射法映射到四个强度类别:睡眠、久坐、轻度、中高强度(MVPA)。
- 外部验证: 模型还在 Realworld 和 WISDM 数据集上进行了测试,以评估其泛化能力。
预处理
- 数据使用
actipy 包进行处理。
- 移除了非佩戴时段(矢量幅度 <15mg 持续 90 分钟)。
- 信号针对静止时段自动校准至 1g。
- 数据被分割为 30 秒窗口,窗口内的真实标签定义为该窗口内出现频率最高的标签。
模型架构
本研究开发了 ActiNet,并将其与 基线 RF + HMM 模型进行了比较。
ActiNet(提出的模型):
- 骨干网络: 一个修改版的 18 层 ResNet-V2(HARNet),在约 70 万个人日的英国生物银行数据上通过自监督学习(SSL)进行预训练。SSL 任务涉及区分加速度计信号中的正向与反向时间箭头。
- 微调: 模型在 CAPTURE-24 数据集上使用 Adam 优化器、交叉熵损失和逆类权重进行微调。
- 数据增强: 应用了随机降采样、轴切换和旋转。
- 平滑处理: 使用维特比算法的隐马尔可夫模型(HMM)对预测序列进行平滑。
- 后处理: 短于 1 小时的睡眠块被重新分类为久坐。
基线模型:
- 分类器: 随机森林(200 个估计器),使用 37 个手工制作的时域和频域特征(来自
accelerometer 包)。
- 平滑处理: 与 ActiNet 相同的 HMM 和睡眠校正逻辑。
训练与评估策略
- 交叉验证: 5 折分层组交叉验证(按参与者 ID 划分,以防止数据泄露)。
- 嵌套验证: 对于 ActiNet,在训练折内使用 20% 的保留集进行早停,并用于估计 HMM 发射矩阵。
- 指标: 准确率、平衡准确率、宏观 F1 分数、Cohen's Kappa、混淆矩阵、活动量的平均绝对误差(MAE)以及 Bland-Altman 图。
3. 主要贡献
- ActiNet 的开发: 一个开源工具,将 SSL 预训练的深度学习(HARNet)与 HMM 平滑相结合,用于腕戴式活动分类。
- 全面的基准测试: 使用相同的数据集和评估协议,与最先进的随机森林基线进行了严格比较。
- 人口统计学分析: 调查了模型在年龄和性别亚组中的偏差,证实了性能提升的一致性。
- 体积分析: 量化了模型选择如何影响估计的每日不同活动强度所花费的时间,这对流行病学关联至关重要。
- 开放科学: 完全发布代码和数据以确保可重复性。
4. 结果
分类性能(CAPTURE-24)
ActiNet 在所有指标上均显著优于基线 RF 模型(p < 0.001):
- 宏观 F1 分数: ActiNet 0.82 对比 基线 0.76。
- Cohen's Kappa: ActiNet 0.86 对比 基线 0.80。
- 准确率: ActiNet 91.1% 对比 基线 87.2%。
- 具体改进: ActiNet 在分类 轻度 和 中高强度 活动时表现出最显著的增益。对于轻度活动,真阳性率从 0.73(基线)提高到 0.85(ActiNet)。
外部验证
ActiNet 在外部数据集(Realworld 和 WISDM)上保持了优越性,将宏观 F1 分数从 0.53 提高到 0.66(Realworld),从 0.68 提高到 0.74(WISDM)。两种模型在非自由生活环境下的轻度活动分类上都存在困难。
活动构成与误差分析
- 体积估计: 与基线相比,ActiNet 显著降低了 睡眠(0.232 小时 vs 0.299 小时)和 久坐 行为(0.492 小时 vs 0.768 小时)的平均绝对误差(MAE)。
- 偏差: 虽然两者的真实标签相关性都很高(>0.8),但 ActiNet 倾向于预测稍多的睡眠和轻度活动,以及较少的久坐和中高强度时间,但其误差分布更紧密(方差更低)。
亚组分析
性能提升在所有年龄段(18–29、30–37、37–52、53+)和性别(男/女)中保持一致,表明深度学习模型未引入显著的人口统计学偏差。
5. 意义与影响
- 流行病学影响: 通过减少活动分类中的随机误差(回归稀释偏差),ActiNet 可以增强健康关联研究(例如,将活动与心血管疾病联系起来)的统计效力。
- 公共卫生: 更准确地估计每日活动构成,有助于制定关于久坐行为和运动指南的更明智的公共卫生信息。
- 方法论转变: 本研究验证了可穿戴分析从手工特征(RF)向表示学习(SSL 深度学习)的过渡,表明预训练模型可以很好地泛化到自由生活数据。
- 权衡: 作者承认,与 RF 模型相比,深度学习模型的可解释性较差且计算负担更重(需要 GPU)。然而,使用预训练权重和开源共享在一定程度上缓解了碳足迹和冗余问题。
结论: ActiNet 代表了开源 HAR 工具的重大进步,为从腕戴式加速度计中提取活动强度标签提供了卓越的准确性和鲁棒性,使其成为未来大规模流行病学研究的推荐工具。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。