← 最新论文
🤖 AI

EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion

EquiFusion 引入了首个与运动学无关的人体动作预测模型,该模型采用一种将骨架连接性作为显式输入的置换等变潜变量扩散架构,从而实现了卓越的跨数据集泛化能力、零样本能力,并以显著高于以往方法的高效性达到了最先进的性能。

原作者: Cecilia Curreli, Florian Hofherr, Dominik Muhle, Abhishek Saroha, Riccardo Marin, Daniel Cremers

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Cecilia Curreli, Florian Hofherr, Dominik Muhle, Abhishek Saroha, Riccardo Marin, Daniel Cremers

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个机器人跳舞。在过去,如果你想让机器人学习“嘻哈”风格,你必须为它构建一个专门的大脑。如果你接着想让它学习“芭蕾”,你就得构建一个完全不同的新大脑,或者尝试强行拉伸、扭曲这个“嘻哈大脑”,试图让它看起来像个“芭蕾大脑”。这种拉伸和扭曲的过程被称为重定向(retargeting),而这篇论文指出,这是一个混乱、易错且会让机器人的平衡感崩溃的噩梦。

EquiFusion 的研究人员表示:“别再为每种舞蹈风格构建一个大脑了。”他们构建了第一个不关心它正在观察什么样的骨架的机器人大脑。无论骨架拥有 17 个关节、22 个关节,甚至由于某些关节缺失(比如隐藏的手臂),这个全新的模型都能用一个单一且灵活的思想来处理这一切。

“魔法”成分:置换等变性(Permutation Equivariance)

要理解他们是如何做到的,想象一群朋友围成一圈手拉手站立。在旧模型中,计算机必须记住谁站在什么位置。如果朋友 A 移动到了朋友 B 的位置,计算机就会感到困惑,因为它被编程为预期朋友 A 出现在特定的座位上。

EquiFusion 使用了一种叫做置换等变性的数学技巧。你可以把它想象成一个通用的翻译器,它理解的是朋友之间的关系,而不是他们的具体座位。无论你如何交换圆圈中朋友的顺序,模型都能理解“手 A 正握着手 B”,而不论是谁站在哪里。这使得模型能够学习一次运动的规则,并将其应用于任何骨架、任何位置,而无需为每种新的身体形状重新训练。

他们排除了什么

论文非常明确地指出了哪些方法是无效的,以及他们正在避免什么:

  • 不再使用“重定向”: 他们明确反对旧的方法,即在将一种骨架类型转换为另一种骨架类型(例如将 17 关节骨架转换为 22 关节骨架)后再喂给模型。他们发现这会引入误差(例如添加会摇晃的假脚),并将数据转移到模型从未见过的奇怪分布中。
  • 不再使用“特定关节”的大脑: 他们拒绝为每个数据集(如 Human3.6M、AMASS 或 Nymeria)训练独立网络的想法。论文证明,权重与特定关节数量或类型绑定的模型无法泛化到新的、未见的骨架。
  • 不再依赖来自 SMPL 的“先验知识”: 他们不依赖于预存在的 3D 人体模型(如 SMPL),因为这些模型需要特定的网格数据或蒙皮信息,而这些信息在现实世界的动作捕捉数据中往往是无法获得的。

结果:更小、更快、更聪明

作者不仅仅是在猜测;他们测量了一切。以下是他们的实验结果:

  • 零样本(Zero-Shot)魔法: 他们在模型从未见过的骨架上进行了测试(例如,在以 22 关节的 AMASS 数据集进行训练后,测试具有 17 关节的 H36M 数据集)。该模型能够“开箱即用”,无需任何额外训练。
  • 巨大的效率提升: 由于它使用一个大脑应对所有身体,该模型的参数量比最接近的竞争对手 SkelDiff 小了 75%。它也运行得快了两倍
  • 更高的准确度: 在标准测试中,它达到了最先进的结果。例如,在 H36M 数据集上,它将预测误差(uADE)降低到了 7.86 厘米(相比之下,需要使用重定向的次优方法为 10.81 厘米)。
  • 处理缺失部分: 在一个“零样本”测试中,他们从输入中隐藏了整个肢体(如一只手臂),模型仍然能够相当好地预测身体其余部分的未来运动,而其他模型则会失败或需要复杂的、人工的修复。

他们有多确定?

论文对这些发现非常有信心,因为他们用严谨的数学和广泛的实验支撑了它们。

  • 经过证明的数学: 他们提供了数学证明(引理 1 和定理 2),表明如果一个模型要处理任意大小的骨架,其权重必须与关节数量无关。他们证明了之前的模型违反了这一规则,而 EquiFusion 在设计上满足了这一要求。
  • 衡量的性能: 他们不仅是在模拟,还在大规模真实世界数据集(AMASS、Nymeria、Human3.6M)上进行了训练,并针对现有的最佳方法进行了测试。结果显示,在零样本场景下,各项指标的性能提升至少为 25%,在真实感方面提升高达 70%
  • 一个局限性: 作者指出一个小小的局限:虽然模型可以处理缺失的“叶节点”关节(如手臂末端的手),但如果中间的关节缺失而末端仍然存在(例如缺少肘部但手还在),它会表现得比较吃力。他们认为这是一个有待未来研究的开放性问题。

简而言之,EquiFusion 表明,我们不再需要强迫世界去适应我们的模型。相反,我们可以构建一个足够灵活的模型来适应世界,无论是一个全身舞者、一个局部视角,还是一个我们从未见过的全新骨架结构。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →