Learning human joint torques from pixels
本文介绍了 VID,这是一个用于直接从单目 RGB 图像中估计人体关节转矩的大规模基于视觉的数据集和基准测试,以及能够通过利用空间和时间特征来实现在现实场景中进行生物力学分析的 VID-Network 模型,该模型显著优于现有的基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一段篮球运动员扣篮的慢动作视频。在肉眼看来,那是纯粹的运动优雅。但在生物力学专家眼中,那一瞬间是看不见的力所构成的混沌风暴。在运动员体内,肌肉像微型发动机一样在爆发,关节则在巨大的压力下像铰链一样运作。科学家们将这种使这些关节运动的扭转力称为“扭矩”(torque)。几十年来,想要准确弄清楚其中有多少扭矩在起作用,就像试图仅通过观察汽车排气管来猜测引擎的马力一样。你看不见齿轮的转动,所以你必须把传感器贴满全身皮肤,把人固定在装有巨型摄像头的实验室里,或者制造一个机器人来假装是他们。这些方法很精确,但也笨重、昂贵,且无法在有人在公园踢足球或在客厅跳舞时使用。一直以来的大问题是:我们能否通过一段简单的视频,瞬间洞察运动背后隐藏的物理学?
这篇论文说:“是的,我们可以,”并且他们构建了工具来证明这一点。研究人员创建了一个庞大的新数据集,名为 VID,它就像一个由 63,369 帧真实人类运动同步视频组成的巨大图书馆。但这不仅仅是一个视频集;它是一个“超级图书馆”,每一帧都附带一张秘密的“小抄”。除了视频,他们还拥有关于关节运动速度和产生多少扭矩的精确数学数据,这些数据都是使用先进的物理软件计算出来的。随后,他们训练了一个特殊的 AI,将其命名为 VID-Network,让它观察视频帧,并学习人体外观与内部不可见力量之间的联系。结果令人印象深刻:该 AI 学会了直接从标准摄像头的像素中预测这些关节扭矩,其表现比之前的最佳方法提高了近 40%。这就像是 AI 仅仅通过观察舞蹈,就学会了阅读“肌肉数学”,而无需任何传感器或机器人的帮助。
无形的引擎室
要理解为什么这意义重大,让我们先拆解这个问题。人类的运动是骨骼、肌肉与重力之间复杂的舞蹈。当你踢球时,你的膝盖不仅仅是在弯曲;它必须产生特定量的扭转力(即扭矩),以克服重力和自身的体重。过去,如果科学家想知道那个数字,他们必须把人放在“实验室笼子”里。他们会将传感器贴在皮肤上以读取肌肉的电信号,将人放在一个可以测量踩踏力的特殊地板上,并用摄像头围绕着人以追踪关节上的微小标记。这就像是通过拆解引擎、测量每一个螺栓并在测试跑道上运行引擎来了解汽车引擎的工作原理。这行得通,但你无法在高速公路上行驶时这样做。
其他科学家尝试了另一种方法,即使用视频游戏和模拟。他们教计算机观察数字机器人的运动并猜测其受力。但有一个陷阱:视频游戏里的机器人运动得并不完全像真人。它们太完美、太流畅,缺乏真实血肉和骨骼的那种细微颤动与不完美。这就像是你只能通过玩赛车游戏来学习如何驾驶真实的汽车;你可能知道规则,但你不会知道当路面颠簸时方向盘的感觉如何。
新的“超级观察者”
本文作者决定跳过实验室笼子和视频游戏机器人。相反,他们在混乱的现实世界与精确的物理世界之间搭建了一座桥梁。他们的第一步是创建 VID 数据集。他们利用现有的真实人类运动开源数据,并完成了同步工作的艰苦任务。想象一下,你拍了一段人跳跃的视频,同时还有一个单独的物理计算电子表格,然后你仔细地将它们对齐,使得视频中的每一帧都与计算中的精确瞬间相匹配。他们最终得到了超过 63,000 帧真实人类的画面,并完整包含了他们的身高、体重以及关节的精确扭矩值。这个数据集就是 AI 将要学习的“教科书”。
接下来,他们构建了 VID-Network,这是一个旨在成为“超级观察者”的智能计算机程序。这个网络由三个主要部分组成,它们像侦探团队一样协同工作:
- 姿态侦探(The Pose Detective): 首先,它观察图像并确定人的关节在 3D 空间中的确切位置。这就像是 AI 在视频上进行脑内绘制一个火柴人骨架。
- 标记追踪器(The Marker Tracker): 然后,它会预测身体特定点(例如肌肉附着点)的位置,即使你看不见它们。这有助于 AI 更好地理解身体结构。
- 时间旅行者(The Time Traveler): 最后,它不仅仅看一张静止的照片。它会观察一系列帧,就像翻阅连环画一样,以理解身体随时间变化的运动方式。它使用一种特殊的“Transformer”大脑(与驱动智能聊天机器人的技术相同)来连接运动的过去、现在和未来,从而推测出受力情况。
结果:看见不可见之物
当他们测试这个新 AI 时,结果具有变革意义。他们将 VID-Network 与目前现有的两种最佳方法进行了对比:一种结合了物理学与传感器,另一种依赖于机器人模拟。旧方法的误差较大,平均误差约为 2.93 和 2.92 单位(以牛顿·米每千克为单位)。然而,新的 VID-Network 将误差降低到了 1.7612 N·m/kg。这意味着提升了 39.81%。
论文显示,这种新方法在几乎所有方面都表现更好。无论是走路、深蹲还是跳下台阶,AI 预测力的准确度都高于旧方法。它在处理像“腰椎伸展”(弯曲下背部)这类复杂动作时表现尤为出色,准确度大幅提升。唯一它稍显逊色的地方是在某些特定的步行模式上,模拟法略占优势,这可能是因为训练数据中有大量的步行案例,导致模拟法在这一特定领域做得非常好。但总体而言,基于真实图像的方法胜出了。
为什么这很重要
这篇论文最令人兴奋的部分不仅在于数字更优,更在于 AI 学会了仅通过真实图像来完成这项工作。它不需要传感器、压力板或机器人模拟。它学会了通过标准视频观察其中的隐形物理学。作者指出,这是首次有人成功构建了一个使用真实人类数据进行此类“基于视觉的逆动力学”的基准。
这为未来打开了大门:我们可以通过对着一个人拍摄一段视频,来分析运动员的运动方式、病人的康复情况或人们在自然环境下的行走状态。虽然论文指出仍有许多工作要做——比如确保 AI 能处理它未曾见过的个体,或应对复杂的“野外”环境——但它已经证明,通过简单视频读取人类运动的梦想不再仅仅是幻想。它已成为现实,并准备好接受真实世界的检验。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。