← 最新论文
📄 other

DeepGaitLab: Accurate and Flexible Markerless Motion Tracking Powered by Synthetic Data

DeepGaitLab 是一个基于合成数据训练的开源无标记 3D 运动追踪框架,它能在多种摄像机配置和临床人群中提供高精度的免校准步态分析,有效地填补了研究级生物力学与可扩展临床部署之间的空白。

原作者: Eni Halilaj, Soyong Shin, Sijia Li, Zhixiong Li, Anastasios Yiannakidis, Hanz Cuevas Velasquez, Chaeeun Lee, Kunwoo Lee, Julian Ng-Thow-Hing, Gelsy Torres-Oviedo, Andrea Rosso, Michael Black

发布于 2026-07-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Eni Halilaj, Soyong Shin, Sijia Li, Zhixiong Li, Anastasios Yiannakidis, Hanz Cuevas Velasquez, Chaeeun Lee, Kunwoo Lee, Julian Ng-Thow-Hing, Gelsy Torres-Oviedo, Andrea Rosso, Michael Black

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

问题陈述
可扩展、高精度的人体运动追踪对于现代化步态病理诊断、优化运动表现以及推动运动研究至关重要。虽然传统的基于标记(marker-based)的动作捕捉系统提供了极高的精度,但由于其依赖于专门的基础设施、专业人员和耗时的校准过程,仅限于实验室环境。无标记(markerless)替代方案为可扩展性提供了路径,但目前面临着精度与灵活性之间的权衡。单视图方法虽然易于获取,但受限于深度歧义和遮挡问题,限制了其临床应用价值。现有的多视图无标记系统要么无法通过增加摄像头来提高精度(例如 OpenCap),要么需要密集的摄像头阵列和专有软件,这阻碍了其在资源受限环境中的部署(例如 Theia3D)。此外,许多现有工具缺乏对行动不便人群的泛化能力,因为它们通常是基于健康人群的数据进行训练的。

方法论
作者提出了 DeepGaitLab,这是一个开源框架,旨在跨越灵活的摄像头配置(从两台到十台摄像头)提供精确的 3D 运动学数据,且无需进行相机间的空间校准。该系统通过三阶段工作流运行:

  1. 2D 密集特征点检测: 不同于检测稀疏关节中心的标准计算机视觉方法,DeepGaitLab 估计了高密度的表面特征点(57 个解剖点)。这是通过一个基于 Transformer 的网络实现的。为了克服多视图标注数据匮乏的问题,该模型利用来自 BEDLAM 数据集的大规模合成数据进行训练。该数据集利用 271 个真实人体(来自 AMASS 数据集)进行的 9.3 小时运动,并在游戏引擎中通过照片级纹理和多样化的服装进行了渲染。该网络采用了迁移学习策略,使用在真实图像上预训练的稀疏关键点检测器(ViTPose)的权重初始化编码器,然后在合成数据上进行微调,以确保泛化能力。
  2. 3D 三角测量与校准: 系统支持两种工作流:一种使用带有物理棋盘格校准的同步视频,另一种是自动校准模式。后者将受试者视为动态校准对象,利用跨视图检测到的密集解剖特征点,通过平差法(bundle adjustment)估计相机外参,从而消除了对物理校准靶标的需求。
  3. 生物力学模拟: 三角测量的 3D 虚拟标记被输入 OpenSim 进行处理。系统将通用的肌肉骨骼模型缩放至受试者的解剖比例,并计算逆运动学和逆动力学(关节力矩)。

一个关键特性是特定环境的微调。该框架可以生成针对特定实验室摄像头几何结构和背景定制的合成训练数据,允许模型针对特定站点进行微调,而无需新的手动标注。

核心贡献

  • 合成数据驱动训练: 通过利用大规模合成数据,DeepGiltLab 避免了实时多视图数据集繁琐的人工标注,同时实现了高精度和高泛化性。
  • 密集特征点表示: 从稀疏关节中心向密集表面特征点的转变,提供了能够更准确地解析肢体段方向的几何约束,解决了稀疏关键点方法固有的歧义性。
  • 灵活且无需校准的操作: 该框架在仅有两台摄像头的情况下也能有效运行,并包含自动校准功能,消除了耗时的手动校准障碍。
  • 对病理状态的鲁棒性: 该系统在包括行动不便人群在内的多样化人群中保持了稳定的性能,而其他工具在这些人群中的表现往往会下降。

结果
作者在 80 名个体身上对 DeepGaitLab 进行了评估,涵盖四个群体:健康成年人、前交叉韧带重建(ACLR)康复者、中风幸存者以及轻度认知障碍(MCI)患者。

  • 精度对比最先进技术(SOTA): 在健康成年人中,DeepGaitLab 的表现始终优于 OpenCap 和 Theia3D。在两台摄像头的设置下,其均方根差(RMSD)显著低于 OpenCap 与基于标记参考值的差异(4.2° vs. 5.9°)。
  • 随摄像头数量的可扩展性: 与 OpenCap 在摄像头从两台增加到十台时精度趋于平缓不同,DeepGaitLab 随着摄像头密度的增加展现出了单调递增的精度提升。
  • 对病理状态的泛化能力: DeepGaitLab 在 ACLR 患者中保持了稳定的性能,在健康组和受损组之间未显示出显著的精度差异。相比之下,OpenCap 和 Theia3D 在 ACLR 组中表现出更高的误差。DeepGaitLab 成功检测到了其他工具未能发现的临床相关性肢体不对称(涉及髋关节屈曲/伸展及内收/外展)。
  • 时空指标: 在 MCI 和中风患者中,DeepGait-Lab 使用仅两台摄像头就达到了与使用八台摄像头的 Theia3D 相当的步长不对称一致性。
  • 逆动力学: 在两台摄像头的设置下,特别是在非矢状面运动期间,DeepGaitLab 在关节力矩估计方面的相对 RMSD 低于 OpenCap。
  • 功能验证: 自动校准功能实现了与手动棋盘格校准相当的性能。特定环境的微调为过路行走任务提供了微小但具有统计学意义的改进,特别是在膝关节和踝关节运动学方面。

意义
本文将 DeepGaitLab 定位为一个实用的、可扩展的平台,弥合了研究级生物力学与临床应用之间的鸿沟。通过证明利用消费级 RGB 摄像头和合成监督即可实现研究级的运动分析,该框架使定量步态分析变得更加普及。作者指出,虽然基于标记的系统长期以来一直是“金标准”,但视觉法接近甚至可能超越这些极限的能力(一旦采用如双平面 X 线摄影等新型、更高保真度的参考标准),可能会重新定义临床评估指标。DeepGaitLab 提供了一个透明、开源的替代方案,打破了由精度、可扩展性或灵活性权衡带来的限制,为临床和实验室的广泛采用提供了可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →