Pose-to-Biomechanics: Bridging 3D Human Pose Estimation and Biomechanical Attribute Prediction
本文介绍了 BioModule,这是一种轻量级、与估计器无关的时间变换器,它通过从标准骨架中预测物理运动属性,将 3D 人体姿态估计与生物力学分析联系起来,并通过一个新对齐的数据集以及针对七种最先进姿态估计器的系统性评估进行了验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人眼睛,它可以观察一段人走路的视频,并立即在他们身上画出一个火柴人骨架。这就是现代“3D姿态估计”所做的事情——它非常擅长确定肘部、膝盖和臀部在空间中的位置。但问题在于:知道关节在哪里并不能告诉你肌肉是如何工作的,或者脚部撞击地面时的力度有多大,亦或是大脑发送了什么样的信号来驱动这种运动。这就像是你知道汽车的轮子正在转动,但完全不知道油箱里有多少油,或者刹车踩了多重。
多年来,如果你想获得这些更深层的“生物力学”细节,必须将人固定在配备了皮肤标记点、地面压力板和无数电线的尖端实验室中。这既昂贵又笨重,而且无法在某人仅仅是在公园里踢足球时实现。
于是有了 BioModule,这是一个由研究人员 Ayda Eghbalian 和 Kevin Desai 提出的新型“插件”工具。你可以把 BioModule 想象成一个神奇的翻译器,它就坐在机器人眼睛的正后方。你把机器人眼睛生成的火柴人骨架喂给它,它就能瞬间推测出隐藏的物理特性:肌肉力量、关节受力以及神经信号。
核心魔术:是翻译器,而非重建器
这个想法最酷的地方在于 BioModule 没有 做什么。论文明确反对认为在想要了解肌肉力量时,必须重建整个机器人眼睛或使用复杂的物理模拟。相反,BioModule 是一个轻量级的“时间变换器”(一种能够观察随时间变化的运动序列的高级 AI 类型),它可以附加到任何现有的姿态估计器的末端。
它就像是一个通用的适配器。无论你的机器人眼睛是旧型号还是全新的、超先进的模型,BioModule 都能直接插入。它接收标准的 17 关节骨架(大多数计算机视觉中使用的标准“火柴人”),并预测 17 种不同的生物力学属性。这些属性分为三个层级:
- 运动学(几何结构): 关节在哪里,它们移动得有多快,以及它们加速或减速的速度有多快。
- 动力学(受力情况): 那些看不见的推力和拉力,比如你膝盖处的扭矩(旋转力)、你的肌肉产生的功率,以及地面反作用力(你蹬地时的力度)。
- 神经肌肉(大脑与肌肉的联系): 产生运动的电信号(兴奋)以及由此产生的肌肉激活。
训练场:一个巨大的电子游戏
为了教会 BioModule 如何完成这项任务,研究人员并没有靠直觉猜测。他们构建了一个庞大的数据集,名为 Human3.6Mplus。想象一下,将著名的“Human3.6M”视频数据集(包含 7 个人进行 30 种不同活动,如行走、坐下和跳舞)与每一个帧对应的超详细物理模拟进行配对。
他们使用了一个名为 OpenSim 的系统来模拟在视频中的每一次动作时,肌肉和骨骼应该是如何运作的。然后,他们进行了严密的侦探式工作,以确保视频中的“火柴人”坐标与“物理模拟”坐标完美匹配。他们将所有内容锚定在骨盆(臀部区域)上,以确保这两个世界在每一帧中都能完美对齐。这使得 BioModule 能够学习从“关节在哪里”到“肌肉在做什么”之间的秘密映射图。
结果:有效,但并不完美
研究人员通过向 BioModule 输入由 七种不同的最先进姿态估计器 生成的骨架进行了测试。他们不仅检查了骨架看起来是否正确,还检查了预测的肌肉力量是否合理。
以下是基于他们的测量结果所发现的情况:
- “即插即用”的成功: BioModule 对所有七种不同的姿态估计器都有效。它证明了你不需要为每个摄像头专门定制一套系统;一个标准的骨架就足以得到一个很好的物理推测。
- “垃圾进,垃圾出”的现实: 生物力学推测的质量高度依赖于原始骨架的质量。如果姿态估计器在膝盖角度上产生了一个微小的、奇怪的误差,预测的肌肉力量可能会变得极其离谱。
- 不同的敏感度: 论文使用 平均绝对误差 (MAE) 来衡量误差。
- 对于 运动学 相关内容(如速度和位置),误差相对较小。例如,在使用基准数据(完美数据)时,速度的误差为 0.193,但当使用名为 MHFormer 的模型时,误差跳升到了 0.403。
- 对于 动力学 相关内容(如受力),误差要大得多,也更加敏感。对于“地面反作用力 (GRF)”,基准数据的误差为 28.900,但使用 MHFormer 时,误差飙升到了 39.000。
- 对于 神经肌肉 相关内容(如肌肉激活),误差也非常显著。基准数据的激活信号误差为 0.058,而 MHFormer 的误差为 0.189。
论文指出,虽然几何结构(关节在哪里)是最容易预测的,但力量和肌肉信号要难得多。姿态的一个小错误可能会导致物理参数的巨大偏差。
这并不是什么
明确说明这篇论文 没有 声称什么是非常重要的。
- 它目前还不是解决“野外视频”问题的万灵药。 论文明确指出,他们的结果是基于受控的实验室视频(Human3.6M),在这些视频中,光照完美且摄像头不会剧烈晃动。他们承认,将此技术应用于存在遮挡、奇装异服或相机抖动的真实世界视频仍是一个未来的挑战。
- 它并不能完全取代物理模拟的需求。 BioModule 学习的是如何预测模拟的结果,但它仍然是一种预测。论文指出,其准确性受限于他们用于训练的基础模拟数据的质量。
- 这还不是一个“已解决”的问题。 作者将此描述为一个“基准”和一座“桥梁”。他们认为,虽然在这些特定条件下效果良好,但要处理现实世界的复杂情况,仍需更多工作。
总结
BioModule 就像是你可以在相机上安装的一个新镜头。它将计算机已经擅长制作的简单“火柴人”提取出来,并在其之上增加了一层“物理意义”。它表明,我们最终可以通过观察一段普通的视频,来分析一个人的运动方式、肌肉的工作强度以及关节承受的载荷,而无需电线或标记点。
然而,论文谨慎地表示,这仅仅是一个开始。该系统目前是一个“插件”,在输入视频清晰且姿态估计器准确时表现最佳。它是让生物力学变得触手可及的一小步,有望让从运动教练到物理治疗师的每个人受益,但它还没有准备好在现在就取代那些高科技实验室。从“膝盖在哪里?”到“膝盖承受多少力?”的旅程现在缩短了一些,但道路仍在铺设之中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。