MoPO: Incorporating Motion Prior for Occluded Human Mesh Recovery
MoPO 是一种新颖的遮挡人体网格重建框架,它利用姿态序列中的运动先验来检测遮挡、预测缺失的关节位置并优化最终姿态,从而在针对遮挡的基准测试和标准基准测试上均实现了最先进的精度和时间一致性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图猜测一位舞者在表演复杂舞步时的样貌。现在,再想象每隔几秒,一棵大树或另一位舞者就会走到他们面前,遮挡住他们身体的部分。如果你只看他们被遮挡的那一帧画面,你可能会猜错他们的手臂位置,或者误以为他们的腿悬浮在半空中。这正是计算机科学家在尝试从部分被遮挡的视频中创建人体 3D 模型时所面临的问题。
本文介绍了一个名为MoPO(用于遮挡人体网格恢复的运动先验)的新系统。可以将 MoPO 想象为一个“超级聪明的猜测者”,它不仅仅观察当前的画面,还会记住舞者最近的动作,以此来填补空白。
以下是其工作原理的简化步骤:
1. 问题:“盲点”
现有技术擅长在人物完全可见时推断其姿态。但当人物被物体或他人遮挡时,计算机就会感到困惑。它试图仅根据能看到的微小身体片段来猜测被遮挡部分的位置。这通常会导致两个糟糕的结果:
- 错误的姿态:计算机可能会猜测被遮挡的手臂以不可能的方式扭曲。
- 抖动动作:在视频中,计算机可能会在这一帧猜测手臂在这里,在下一帧又猜在那里,导致 3D 模型看起来像是在不受控制地颤抖或震动。
2. 解决方案:MoPO 的“记忆长廊”
MoPO 通过认识到运动具有规律性来解决这一问题。如果你看到某人的手臂在过去三帧中向上移动,即使一棵树挡住了你的视线,你也能相当确定它在下一帧的位置。MoPO 利用这种“运动记忆”来修复盲点。
它主要通过两个阶段来实现:
阶段 A:“填空”侦探
首先,MoPO 像一名检查监控摄像头的侦探。
- 发现遮挡:它查看视频并检查:“身体这部分现在可见吗?”它使用一种特殊的检测器,结合当前图像和近期过往画面,来判断关节(如膝盖或手肘)是否被遮挡。
- 预测缺失:如果某个关节被遮挡,MoPO 不会随机猜测。它利用一个轻量级的“运动预测器”(可以将其视为短期记忆库),查看该关节前一时刻的位置及其运动趋势。然后,它以高概率的猜测补全骨骼的缺失部分。
- 类比:想象你正在观看魔术师从帽子里变出一只兔子,但窗帘在瞬间挡住了你的视线。普通观察者可能会认为兔子消失了。然而,MoPO 记得在窗帘落下前兔子正在向上移动,因此它会在窗帘后方“填补”兔子的位置,使魔术看起来是连续的。
阶段 B:“混合与抛光”大厨
一旦 MoPO 拥有了一个“补全”的骨骼(即缺失部分已被填补),它就需要将这个骨骼转化为完整的 3D 人体(包括皮肤等)。
- 混合原料:它将“补全的骨骼”(运动记忆)与视频中的实际视觉细节(如衬衫的颜色或躯干的形状)进行混合。
- 优化姿态:有时,仅猜测位置是不够的;关节需要正确旋转。MoPO 使用一种称为“逆运动学”的技术(就像木偶师调整提线一样),确保 3D 人体动作自然,看起来不像一个坏掉的机器人。它将肢体的“摆动”(容易观察)与“扭转”(较难观察)区分开来,以获得完美的旋转角度。
3. 结果:流畅、精准的舞蹈
作者在许多人物被物体或其他人遮挡的不同视频中测试了 MoPO。
- 准确性:MoPO 的准确性显著优于以往的最先进方法。与现有最佳工具相比,它将关节位置预测的误差降低了约 8.5% 至 12%。
- 流畅度:最大的胜利在于视频稳定性。由于 MoPO 使用了“运动记忆”,当人物被遮挡时,3D 模型不会出现抖动或震动。动作流畅自然,就像真实的人类一样。
总结
简而言之,MoPO是一个通过以下方式从视频中恢复 3D 人体模型的系统:“我现在看不见你的手臂,但我知道它确切在哪里,因为我记得你一秒钟前是如何移动的。”通过将这种运动记忆与它能看到的视觉线索相结合,即使在混乱、拥挤或被遮挡的场景中,它也能创造出更准确、更稳定的 3D 重建。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。