想象一下,你是一位试图教学生如何完成完美深蹲的教练。在过去,你必须拿着秒表和写字板站在那里,眯着眼睛观察他们的膝盖弯曲程度是否正确。如今,我们有了摄像机和计算机,它们可以观察一个人的动作,并将人体转化为由点和线组成的数字火柴人。这被称为“基于骨骼的运动”。这就像是给一个人拍张照片,然后用由发光关节组成的骨架取代他们的血肉。
长期以来,计算机非常擅长识别你在做什么——比如区分走路和跑步。但在物理治疗和康复领域,问题不在于“你在做什么?”,而在于“你做得有多好?”患者是否向前倾斜得太多了?他们的动作是否太慢了?这是一个更难的谜题,因为它需要发现那些看起来大致正确但实际上存在细微偏差的动作。直到现在,试图解决这个谜题的科学家们一直处于孤立状态,每个人都使用自己的一套小型练习题和自己的评分规则。这就像是有十所不同的学校,有着十种不同的数学测试;如果每个人的评分标准都不一样,你根本无法判断哪位老师教得最好。
这篇论文介入并解决了这个混乱局面。作者们是一支来自法国、意大利和澳大利亚的研究团队,他们决定为测试“计算机大脑”建立一个巨大的、统一的“健身房”。他们收集了来自各种现有来源的 60 个不同运动数据集,并将它们整合进一个巨大的档案库中,称之为“Rehab-Pile”。把这想象成在为康复领域创建一套单一且庞大的标准化考试。然后,他们拿出了九种不同类型的计算机模型——从简单的模式检测器到模仿人类如何关注细节的复杂“注意力”系统——并在这些 60 个数据集上对它们进行了全方位的测试。
结果呢?他们发现了一个明确的冠军。一个名为 LITEMV(代表带有提升技术的轻量级 Inception 多变量模型)的模型表现最为出色。它在识别错误方面最准确,而且效率最高,这意味着它不需要超级计算机来运行;它很可能可以在普通笔记本电脑甚至手机上运行。虽然其他使用复杂的“自注意力”机制(类似于驱动聊天机器人的技术)的高级模型表现也不错,但它们通常速度较慢或需要更多的计算能力。该论文指出,对于检查患者是否正确进行康复训练这一特定任务,LITEMV 是我们目前拥有的最可靠的工具。他们还确保向公众分享了所有的代码和数据,以便其他科学家可以验证结果并构建更好的工具,从而最终让每个人都有一个公平的方式来比较谁正在赢得这场自动化康复的竞赛。
技术摘要:基于深度学习的骨骼运动康复评估标准化基准测试
问题陈述
人体运动的自动化评估对于康复至关重要,它能为患者的进展和练习执行情况提供客观评价。然而,康复运动评估与一般的动作识别有着本质的区别。动作识别旨在分类正在进行的动作(例如,行走与跑步),而康复评估则是评估特定动作的“质量”,需要检测与理想动作之间的细微偏差。
尽管深度学习和基于视频的骨骼提取技术取得了进展,但该领域仍缺乏标准化的基准测试、一致的评估协议和可复现的方法论。现有的研究通常依赖于一组有限的数据集(特别是 KIMORE 和 UI-PRMD),使用不一致的实验协议(变化的训练/测试集划分和指标),并且经常未能发布源代码。这种统一框架的缺失阻碍了人们客观比较不同方法、复现结果或评估其在不同人群和运动类型中的泛化能力。
方法论
为了填补这些空白,作者提出了一个以三个支柱为核心的综合基准测试框架:
Rehab-Pile 存档: 作者将九个现有的公开仓库聚合为一个名为“Rehab-Pile”的统一存档。该存档将每个仓库中的特定练习视为一个独立的数据集,总计包含 60 个数据集:
- 39 个分类数据集: 涵盖二分类和多分类任务(例如,正确执行与错误执行,或特定的错误类型)。
- 21 个外在回归数据集: 涵盖连续得分预测(例如,严重程度等级或表现评分)。
- 数据由从视频流(RGB 或 RGB-D)中提取的骨骼序列(关节坐标)组成,主要通过 Kinect 传感器或 OpenPose 获取。
统一评估框架: 本研究在所有 60 个数据集上对 九种深度学习架构 进行了评估,并遵循严格的标准协议:
- 架构: 模型涵盖四类:基于卷积的模型(FCN、H-Inception、LITEMV、DisjointCNN)、基于循环的模型(MotionGRU、ConvLSTM)、基于自注意力机制的模型(VanTran、ConvTran)以及基于图的模型(STGCN)。
- 数据预处理: 所有序列都被重采样为统一的每数据集帧数,使用最小-最大缩放进行归一化(仅基于训练数据计算),并转换为多元时间序列格式(展平关节和维度轴),但 STGCN 除外,它使用原始骨骼序列。
- 实验协议: 强制执行跨受试者划分(cross-subject split)以防止数据泄露。折数(folds)的数量由受试者数量决定(若受试者 ≥ 10 人则采用 5 折交叉验证,否则采用留一受试者法)。
- 集成: 为了稳定结果,每个模型在每一折中都使用不同的随机初始化进行五次训练,并对预测结果取平均值。
- 指标: 分类任务使用准确率(Accuracy)和平衡准确率(Balanced Accuracy)进行评估。回归任务使用平均绝对误差(MAE)和均方根误差(RMSE)。效率通过训练/推理时间、参数量和 FLOPs 进行衡量。
统计分析: 使用多重比较矩阵(MCM)和 Wilcoxon 符号秩检验来确定模型之间性能差异的统计显著性(p<0.05)。
关键结果
广泛的基准测试得出了以下发现:
- 回归性能: LITEMV(带有提升技术的轻量级 Inception 多变量模型)脱颖而出,成为统计学意义上表现最佳的外在回归模型,在 MAE 和 RMSE 方面均优于所有竞争对手。作者将其归功于 LITEMV 使用了深度可分离卷积(DWSCs)和手工设计的滤波器,这使其能够有效地捕捉时空相关性。ConvTran(一种带有卷积嵌入的自注意力模型)排名第二,表明长程依赖关系对于回归任务至关重要。
- 分类性能: 在分类任务中,LITEMV 同样实现了最高的平均准确率(75.49%)和平衡准确率,尽管其与 VanTran(Vanilla Transformer)之间的差距在统计上并不显著(p>0.05)。MotionGRU 在平衡准确率方面排名第二,在不平衡数据集上表现良好。值得注意的是,STGCN(时空图卷积网络)虽然在回归任务中表现尚可,但在分类任务中排名垫底,这表明在当前条件下,基于 GCN 的架构可能不太适用于康复分类任务。
- 效率与性能的权衡: LITEMV 展示了最佳的整体权衡,在提供顶尖性能的同时,拥有最低的参数量和 FLOPs。MotionGRU 的推理速度最快,而 ConvTran 的训练速度最快。VanTran 的计算成本最高,因为其 FLOPs 随序列长度呈二次方增长,且具有多个注意力层。
- 模型特性: 结果表明,简单的 CNN(FCN)和标准的 LSTM(ConvLSTM)的表现逊于更专门的架构。LITEMV 和 ConvTran 的成功凸显了捕捉局部时间模式(通过卷积)和全局依赖关系(通过注意力或循环记忆)的重要性。
意义与主张
本文声称通过以下方式为未来的自动化康复评估研究奠定了坚实基础:
- 标准化领域: 提供第一个统一的存档(Rehab-Pile),包含 60 个多样化的数据集和一个可复现的评估协议,从而实现研究间的公平比较。
- 确定最先进技术(SOTA): 证明 LITEMV 是目前最有效且最高效的基于骨骼的康复评估架构,尤其是在回归任务方面,同时强调了 Transformer 模型在分类任务中的潜力。
- 促进可复现性: 向社区发布所有聚合的数据集、源代码和详细的实验结果,以促进透明度并加速开发可靠、易用且个性化的康复解决方案。
作者强调,尽管 LITEMV 目前处于领先地位,但分类任务仍然具有挑战性(平均准确率约为 75%),这表明仍需继续探索模型架构以进一步提高性能。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。