想象一下,你正在观看一个人跑步的电影。标准的计算机程序可以告诉你人物的肢体在哪里移动(即“是什么”),但它完全不知道人物是如何做到的(即“为什么”)。它不知道哪些肌肉在收缩、它们施加了多大的拉力,或者内部存在哪些作用力。这就像观看木偶戏,却只能看到线在动,而不理解操偶师的手劲或线的张力。
这篇题为"BioHuman"的论文试图通过教会计算机识别人类运动中“不可见”的内部力学机制,而不仅仅是可见的外壳,来解决这一问题。
以下是他们如何实现这一点的分解说明,使用了简单的类比:
1. 缺失的拼图:BioHuman10M
要教会计算机理解肌肉,你需要一个庞大的示例库,其中既能看到动作,又能同时看到肌肉活动。
- 问题:真实世界的数据非常稀缺。你无法轻易地将传感器绑在成千上万的人身上,在拍摄他们动作的同时记录肌肉信号。
- 解决方案:作者构建了一个名为BioHuman10M的巨型数字图书馆。你可以将其视为一个“模拟现实”。他们利用现有的人物运动视频,通过一个高科技物理引擎(类似于视频游戏引擎,但是针对真实人类生物学)进行处理。
- 工作原理:他们将视频数据输入计算机的“肌肉大脑”(一个名为 OpenSim 的模拟系统)。该引擎计算出为了产生特定动作,肌肉必须做了什么。
- 结果:他们创建了 1000 万对“视频 + 肌肉数据”。这就像拥有一本教科书,其中每一张人物跑步的图片都附带了详细的肌肉工作地图,精确显示哪些肌肉在工作以及工作强度如何。
2. 新模型:BioHuman
既然有了这本教科书,他们便构建了一个名为BioHuman的新人工智能模型。
- 旧方法(两步走):以前的方法就像一场交接糟糕的接力赛。首先,一个 AI 猜测身体的姿态(即“是什么”)。然后,第二个 AI 仅基于这个猜测来推断肌肉活动。如果第一个 AI 犯了一个微小的错误,第二个 AI 就会感到困惑,导致误差累积。
- BioHuman 方法(一步走):这个模型就像一名单独的侦探,它观看视频并一次性解开整个谜团。它不仅猜测姿态,还同时猜测姿态和肌肉活动。
- 为何更好:该模型认识到运动与肌肉是紧密锁定的。如果你看到一个人身体前倾,模型会利用这一视觉线索来推测肌肉活动;如果它看到特定的肌肉模式,它也会利用这一点来细化对身体姿态的猜测。它们相互辅助,就像两个朋友共同拼凑拼图,而不是来回传递碎片。
3. 结果
当他们测试这个新模型时:
- 看得更深:与旧的“两步走”方法相比,它能更准确地预测肌肉活动。
- 动得更好:有趣的是,通过迫使 AI 思考肌肉,它在猜测身体位置方面实际上也变得更好了。这就像理解了引擎原理后,汽车的行驶反而更平稳了。
- 具备泛化能力:它在不同的人和不同类型的动作上表现良好,而不仅仅局限于它专门训练过的内容。
核心结论
这篇论文介绍了一个新的数据集(BioHuman10M),该数据集为数百万个视频片段模拟了肌肉数据;同时介绍了一种新的人工智能(BioHuman),它能够学习观看视频,并即时理解可见的运动以及驱动这些运动的不可见的肌肉力量。
关于局限性的重要说明:
作者诚实地指出了他们的“模拟现实”目前能做什么和不能做什么:
- 颈部:他们的模拟模型尚未完全涵盖颈部运动,因此该部分的数据是不完整的。
- 模拟与现实:由于肌肉数据是由计算机模拟生成的(而非在真人身上使用真实传感器),他们的“数字真相”与真实人类生物学之间仍存在差距。
- 仅限脚部:目前,该系统仅理解脚部接触地面时的受力情况。它尚不理解手推墙或人坐下时会发生什么。
简而言之,他们建立了第一座连接“我们所见”(视频)与“内部发生之事”(肌肉)的主要桥梁,为计算机以更完整的方式理解人类运动奠定了基础。
技术摘要:BioHuman——从视频中学习生物力学人体表征
1. 问题陈述
传统上,从视频中理解人体运动主要关注表面运动学(例如通过 SMPL 获取的关节位置和身体形状),这描述了人类“如何”运动,但无法从潜在的生理机制层面解释人类“为何”这样运动。从视频中推进生物力学理解的一个重大障碍,是缺乏能够同时提供视觉观测、人体运动以及内部生物力学状态(具体为肌肉激活)的大规模数据集。现有数据集在这些模态上往往不完整,而收集包含同步视频、动作捕捉和肌电图(EMG)的真实世界数据则成本高昂且数据稀疏。
此外,当前的计算方法通常采用解耦的两阶段流程:首先从视频中重建运动学运动,然后分别通过生物力学模拟或神经近似来估计肌肉激活。这种分离并非最优,因为运动重建误差不可避免地会传播到下游的生物力学推断中,且这两个过程本质上由肌肉骨骼系统相互耦合。
2. 方法论
2.1 BioHuman10M:大规模生物力学数据集
为解决数据稀缺问题,作者引入了BioHuman10M,这是一个包含 1000 万对帧的数据集,将真实世界的视觉运动与基于物理的肌肉骨骼状态对齐。
- 数据来源:该数据集聚合了来自五个现有动作捕捉数据集的序列:MotionPRO、EMDB、3DPW、Human3.6M 和 BEDLAM。
- 模拟框架(BioSim):由于大多数数据源缺乏真实的肌肉激活数据,作者开发了BioSim模拟流程来生成这些数据:
- SMPL 到 OpenSim:使用自定义的全身体肌肉骨骼模型(ULBS-112,包含 112 块肌肉),将 SMPL 运动序列转换为 OpenSim 兼容的运动学数据。
- 逆运动学(IK):从 SMPL 中提取标记轨迹以缩放 ULBS-112 模型并执行逆运动学,从而恢复关节角度轨迹。
- 地面反作用力(GRF):由于 SMPL 数据中不包含地面反作用力,它们基于关节运动学和估计的身体参数,利用GaitDynamic进行合成。
- 肌肉激活估计:利用逆动力学(ID)计算关节力矩,并通过**静态优化(SO)**解决肌肉冗余问题,系统在满足动力学约束的前提下,通过最小化努力成本函数(∑aip)来估计肌肉激活(ai(t))。
- 后处理:过滤不可靠的序列,并应用时间平滑以确保激活动力学的连贯性。
2.2 BioHuman:端到端框架
作者提出了BioHuman,这是一个统一的端到端框架,直接从单目视频预测人体运动(SMPL 姿态)和肌肉激活,绕过了解耦流程。
- 架构:
- 前端编码器:利用PromptHMR(冻结的图像编码器)提取初始 SMPL 姿态估计和每帧的图像条件 HMR 特征。
- 视觉 - 运动学接口:原始姿态和视觉特征被编码为时间姿态令牌和视觉令牌。一个学习到的门控机制将视觉证据注入姿态流中,使模型能够在运动学数据模糊时利用图像线索(例如遮挡处理、朝向)。
- 运动 - 视觉时间 Transformer:交错令牌序列(交替的姿态和视觉令牌)由 Transformer 解码器处理。这种结构使模型能够推理长程时间依赖关系和跨模态交互,捕捉到肌肉激活不仅取决于瞬时姿态,还取决于相位、速度和接触的事实。
- 解码头:融合状态由两个头进行解码:
- 姿态头:预测对初始 SMPL 姿态的残差修正。
- 肌肉头:预测 112 维的肌肉激活向量。
- 训练目标:该模型通过多任务监督进行训练,结合了姿态准确性、肌肉激活准确性、时间差分匹配、激活相关性和幅度校准。
3. 主要贡献
- BioHuman10M 数据集:引入了一个大规模(1000 万帧)的数据集,通过新颖的模拟流程(BioSim)增强现有动作捕捉数据,从而连接了视觉、运动和全身肌肉激活。
- BioHuman 框架:一种端到端的神经架构,从单目视频联合建模人体运动和肌肉激活,将其视为耦合表征学习问题,而非顺序任务。
- 实证验证:广泛的实验表明,联合建模在生物力学预测和运动学重建方面均显著优于两阶段基线。
4. 实验结果
作者在 BioHuman10M 测试协议上评估了 BioHuman,将其与强大的两阶段基线(PromptHMR + MinT)及现有的单目 HMR 方法进行了比较。
- 肌肉激活预测:BioHuman 实现了 0.71 的皮尔逊相关系数(PCC),显著优于两阶段基线(PCC 0.42)。其均方根误差(RMSE)也更低(0.065 对比 0.071),并且在活跃肌肉放电方面表现更好(Active MAE 0.10 对比 0.12)。
- 运动估计:与联合训练可能会降低运动学准确性的担忧相反,BioHuman 提高了姿态估计精度。其 RMSEPose 达到 0.30 rad,PA-MPJPE 达到 35.21 mm,优于 PromptHMR 等最先进 HMR 基线(0.53 rad, 40.89 mm)。
- 消融研究:移除端到端的视觉 - 运动学耦合(使用具有固定 HMR 姿态的两阶段级联)导致 PCC 从 0.71 下降到 0.58,证实了联合优化的优势。
5. 意义与主张
该论文声称,BioHuman 为基于视频的生物力学理解建立了新基准。通过超越表面运动学以推断内部肌肉骨骼状态,这项工作为康复、运动分析和辅助技术(例如外骨骼)的应用开辟了新的可能性。
作者强调,他们的方法弥合了视觉观测与生理现实之间的差距。他们指出,虽然该数据集基于模拟且目前仅限于脚 - 地交互(缺乏颈部自由度和手 - 物交互),但它为学习基于生物力学的人体表征提供了可扩展的基础。未来的工作计划将这些预测与真实 EMG 数据进行验证,并整合解剖学上更精确的身体模型(例如 OSSO)。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。