ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation
本文介绍了 ARDY,这是一个流式生成框架,它利用混合表示和两阶段自回归 Transformer 去噪器,实现了具有实时性、高保真度 3D 人体动作生成能力,并能对在线文本提示进行精确控制以及对长程运动学约束进行灵活处理。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在玩一款电子游戏,你想让你的角色做一些酷炫的动作,比如“向左快速绕圈跑,然后停下”,或者“悄悄地横着走”。在过去,想要实时让角色做出这些动作就像是在有人不断变换指令的情况下试图创作一幅杰作。你要么得预先规划好整个过程(这既慢又枯燥),要么就得让角色即兴发挥(但这往往看起来很奇怪,且会忽略你具体的指令)。
迎来 ARDY,一个改变游戏规则的新型数字木偶大师。把 ARDY 想象成一位超级快速、超级聪明的即兴表演艺术家,它既能听从你的语音指令,也能遵循你在地板上画出的路径图,而且动作之快,眨眼间即可完成。
魔法秘诀:两个大脑,一个身体
ARDY 的核心奥秘在于它观察人体的方式。它并没有试图一次性计算每一个手指和脚趾(这是一项繁琐且沉重的任务),而是将任务拆分为两个截然不同的部分,就像一位导演和一位舞者。
- 导演(根节点/Root): 这部分处理“宏观”运动——角色要去哪里、移动速度有多快以及面向哪个方向。论文称之为“显式根节点”(explicit root)。这就像导演在喊:“向左走!停在那儿!”
- 舞者(身体/Body): 这部分处理实际的肢体动作、身体摇摆、手臂摆动和脚步动作。论文称之为“潜在身体嵌入”(latent body embedding)。这就像舞者在倾听导演的指令,并思考如何通过精妙的步伐来匹配情绪。
通过分离这两者,ARDY 可以非常精确地控制角色去哪里(导演),而不会被每个关节的数学计算所困扰(舞者)。这使得它能在仅 33 毫秒内生成高质量的动作——这比你眨一下眼还要快!
“混合型”超能力
论文指出,旧的方法要么试图同时处理所有事情,要么依赖于耗时较长的逐步猜测,无法满足实时游戏的需要。ARDY 拒绝了“必须在‘快速’和‘可控’之间做选择”的观点。
相反,它使用了一种混合表示法(hybrid representation)。想象一下你在给朋友指路。你不会说:“左脚向前迈 3 英寸,右脚向前迈 2 英寸。”你会说:“走到那把红椅子那里。”ARDY 也是如此。它将“去哪里”(根节点)保持在一种清晰、易读的格式中,同时将“如何移动”(身体)压缩成一段微小且高效的代码。这让计算机能够瞬间处理这些指令。
两阶段舞蹈
为了确保导演和舞者不会互相绊倒,ARDY 使用了一个两阶段过程。
- 第一阶段: 它首先确定角色的脚应该在地面上的确切位置(根轨迹)。
- 第二阶段: 只有在确定了脚的位置之后,它才会计算身体的其他动作。
作者发现,如果你试图同时猜测脚部和手部的动作,结果往往会变得摇晃混乱。通过这种特定的顺序,角色能保持平衡并完美遵循你的指令。
它能做什么(以及不能做什么)
论文表明,ARDY 在以下方面表现出色:
- 倾听你: 你可以输入“一个人打开门并走出来”,它就会实现。
- 遵循路径: 你可以用鼠标点击地板上的一个点,角色就会走向那里。
- 精准达成姿态: 你可以告诉它,“定格在这个精确的姿势上”,它就会瞬间到位。
- 长期规划: 它可以记住一个遥远的目标(比如 10 秒后的目的地)并规划到达那里的步骤,而以前的“在线”方法在处理这类问题时表现不佳。
然而,论文也非常明确地说明了 ARDY 不是什么。它纯粹是一个**运动学(kinematic)*模型。这意味着它计算的是关节的位置*,但它并不真正理解物理学,如重力、肌肉力量或惯性。
- “足部滑动(Foot Skating)”问题: 因为它不模拟物理,所以有时角色的脚可能会像在冰面上一样在地面上滑动(这个问题被称为“足部滑动”)。论文承认这种情况确实会发生,尤其是在角色本该站立不动但数学计算出现轻微偏差时。他们在训练期间加入了一个特殊的惩罚项来阻止这一现象,但这并不是一个完美的物理引擎。
- 没有“真实”重量: 它不知道重物会导致角色踉跄,它只知道关节应该如何移动才能看起来像是正在做那个动作。
成果验证
团队在海量的真实人类运动数据集(称为 Bones Rigplay,包含约 700 小时的数据)以及标准的 HumanML3D 基准测试上对 ARDY 进行了测试。
- 他们发现,在遵循指令和遵循路径方面,ARDY 优于其他顶尖方法。
- 在与类似方法 DiP 的面对面测试中,人类测试者在质量方面有 65.8% 的时间更倾向于 ARDY,在遵循文本描述方面有 67.5% 的时间更倾向于 ARDY。
- 在达成特定目标(如关节位置)方面,ARDY 的准确度更高,误差约为 2.48 厘米,而另一种方法的误差为 9.20 厘米。
总结
ARDY 表明,通过将“去哪里”与“如何去”分离,并结合一种聪明的两步猜测游戏,我们终于可以拥有既快速又听话的视频游戏角色。它不是一个完美的物理模拟器(它可能仍然会在冰面上滑行),但对于制作能根据你的指令实时跳舞、奔跑和做出反应的角色来说,这是一个巨大的飞跃。作者们对这种方法的效果充满信心,但也承认,未来的版本可能需要学习真正的物理学,以彻底解决足部滑动的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。