← 最新论文
🤖 machine learning

BioHuman: Learning Biomechanical Human Representations from Video

本文介绍了 BioHuman,这是一个在 newly 创建的 BioHuman10M 数据集上训练的全端到端模型,旨在从单目视频中直接推断内部肌肉激活和人体运动,从而弥合视觉观测与生物力学状态之间的差距,以应用于康复和损伤评估。

原作者: Yujun Huo, He Zhang, Chentao Song, Honglin Song, Zongyu Zuo, Tao Yu

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Yujun Huo, He Zhang, Chentao Song, Honglin Song, Zongyu Zuo, Tao Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一个人跑步的电影。标准的计算机程序可以告诉你人物的肢体在哪里移动(即“是什么”),但它完全不知道人物是如何做到的(即“为什么”)。它不知道哪些肌肉在收缩、它们施加了多大的拉力,或者内部存在哪些作用力。这就像观看木偶戏,却只能看到线在动,而不理解操偶师的手劲或线的张力。

这篇题为"BioHuman"的论文试图通过教会计算机识别人类运动中“不可见”的内部力学机制,而不仅仅是可见的外壳,来解决这一问题。

以下是他们如何实现这一点的分解说明,使用了简单的类比:

1. 缺失的拼图:BioHuman10M

要教会计算机理解肌肉,你需要一个庞大的示例库,其中既能看到动作,又能同时看到肌肉活动。

  • 问题:真实世界的数据非常稀缺。你无法轻易地将传感器绑在成千上万的人身上,在拍摄他们动作的同时记录肌肉信号。
  • 解决方案:作者构建了一个名为BioHuman10M的巨型数字图书馆。你可以将其视为一个“模拟现实”。他们利用现有的人物运动视频,通过一个高科技物理引擎(类似于视频游戏引擎,但是针对真实人类生物学)进行处理。
  • 工作原理:他们将视频数据输入计算机的“肌肉大脑”(一个名为 OpenSim 的模拟系统)。该引擎计算出为了产生特定动作,肌肉必须做了什么。
  • 结果:他们创建了 1000 万对“视频 + 肌肉数据”。这就像拥有一本教科书,其中每一张人物跑步的图片都附带了详细的肌肉工作地图,精确显示哪些肌肉在工作以及工作强度如何。

2. 新模型:BioHuman

既然有了这本教科书,他们便构建了一个名为BioHuman的新人工智能模型。

  • 旧方法(两步走):以前的方法就像一场交接糟糕的接力赛。首先,一个 AI 猜测身体的姿态(即“是什么”)。然后,第二个 AI 仅基于这个猜测来推断肌肉活动。如果第一个 AI 犯了一个微小的错误,第二个 AI 就会感到困惑,导致误差累积。
  • BioHuman 方法(一步走):这个模型就像一名单独的侦探,它观看视频并一次性解开整个谜团。它不仅猜测姿态,还同时猜测姿态肌肉活动。
  • 为何更好:该模型认识到运动与肌肉是紧密锁定的。如果你看到一个人身体前倾,模型会利用这一视觉线索来推测肌肉活动;如果它看到特定的肌肉模式,它也会利用这一点来细化对身体姿态的猜测。它们相互辅助,就像两个朋友共同拼凑拼图,而不是来回传递碎片。

3. 结果

当他们测试这个新模型时:

  • 看得更深:与旧的“两步走”方法相比,它能更准确地预测肌肉活动。
  • 动得更好:有趣的是,通过迫使 AI 思考肌肉,它在猜测身体位置方面实际上也变得更好了。这就像理解了引擎原理后,汽车的行驶反而更平稳了。
  • 具备泛化能力:它在不同的人和不同类型的动作上表现良好,而不仅仅局限于它专门训练过的内容。

核心结论

这篇论文介绍了一个新的数据集(BioHuman10M),该数据集为数百万个视频片段模拟了肌肉数据;同时介绍了一种新的人工智能(BioHuman),它能够学习观看视频,并即时理解可见的运动以及驱动这些运动的不可见的肌肉力量。

关于局限性的重要说明
作者诚实地指出了他们的“模拟现实”目前能做什么和不能做什么:

  • 颈部:他们的模拟模型尚未完全涵盖颈部运动,因此该部分的数据是不完整的。
  • 模拟与现实:由于肌肉数据是由计算机模拟生成的(而非在真人身上使用真实传感器),他们的“数字真相”与真实人类生物学之间仍存在差距。
  • 仅限脚部:目前,该系统仅理解脚部接触地面时的受力情况。它尚不理解手推墙或人坐下时会发生什么。

简而言之,他们建立了第一座连接“我们所见”(视频)与“内部发生之事”(肌肉)的主要桥梁,为计算机以更完整的方式理解人类运动奠定了基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →