← 最新论文
💻 computer science

OmniMotion-X: Versatile Multimodal Whole-Body Motion Generation

OmniMotion-X 是一个最先进且通用的多模态框架,它利用自回归扩散 Transformer 和一种新颖的参考运动调节策略,并在最大的统一运动数据集(OmniMoCap-X)上进行了训练,用以在诸如文本生成运动、音乐生成舞蹈以及语音生成手势等多样化任务中,生成逼真、连贯且可控的全身人体运动。

原作者: Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个机器人跳舞。你可以告诉它:“挥动你的左臂”,或者播放一首歌并说:“跟着这个节拍跳舞”。但如果你想让机器人同时完成所有动作呢?如果你想让它既能听音乐,又能跟随一段口述的故事,还能对地面上的特定路径做出反应,同时看起来还要像真人一样动作自然呢?这就是“动作生成”(motion generation)领域的圣杯——在这个领域,计算机科学家试图教会机器如何从无到有地创造人类的动作。长期以来,这些机器人就像笨拙的初学者:它们可以随音乐起舞,或者根据文本提示进行表演,但它们无法将这些技能融合在一起。它们通常也是在杂乱的数据上进行训练的,就像试图通过观看人们在泳池里溅起水花的模糊视频来学习游泳,而不是观看专业游泳运动员清晰的影像。研究人员提出的核心问题是:我们能否构建一个单一的“大脑”,让它能同时理解所有这些不同的指令,从高质量的数据中学习,并创造出流畅、逼真且持久的人类动作,而不会因为动作不协调而把自己绊倒?

于是有了 OmniMotion-X,这是一个像为数字动作交响乐团指挥超级力量般的项目。把以往的动作生成 AI 模型想象成只能完美演奏一种乐器的独奏者:如果你想要小提琴独奏,你就找一个模型;如果想要架子鼓独奏,你就找另一个模型。它们无法一起即兴合奏。然而,OmniMotion-X 是一个统一的“序列到序列”(sequence-to-sequence)模型。想象它是一位大师级的讲述者,它不仅能阅读剧本(文本)或聆听节拍(音乐),还能观察之前的场景(参考动作),并说:“好的,基于他们刚才的动作方式,接下来他们应该如何移动。”它使用了一种巧妙的技术——“扩散 Transformer”(Diffusion Transformer),这就像一位雕塑家,从一块充满噪声和静电的粘土块开始,慢慢凿去噪声,直到呈现出一个完美、流动的舞蹈。

这里的秘诀在于研究人员是如何教导这个模型的。他们并没有一次性把所有可能的指令都丢给机器人——这就像是在同一秒钟内试图教一只狗坐下、待命、捡球和翻滚——而是使用了“由弱到强”(weak-to-strong)的训练策略。首先,他们教导模型简单的概念,比如“根据这个故事移动你的身体”。一旦机器人掌握了基础知识,他们就会慢慢加入更难的约束条件,比如“现在匹配这个特定的节奏”或者“现在遵循这条精确的路径”。这种循序渐进的方法防止了机器人感到困惑或应接不暇。

但聪明的头脑需要优质的数据,而这正是这篇论文的另一大亮点。团队意识到,大多数现有的动作数据集就像是从不同盒子里抓出来的零散拼图碎片:有些是低质量的估算值,有些描述不一致,而且没有一个能完美契合。为了解决这个问题,他们构建了 OmniMoap-X,这是有史以来最大的统一动作数据集。他们收集了 28 个高质量的动作捕捉来源——可以把这些想象成 28 个穿着高科技套装的专业舞蹈团和演员的录像——并将它们全部整合进一个巨大的、组织严密的库中。他们对所有内容进行了标准化,使机器人对于每一个动作都使用同一种“语言”(称为 SMPL-X)。他们甚至使用了先进的 AI 来观察这些动作的视频,并撰写详细、结构化的故事来描述正在发生的事情,从而确保机器人不仅理解一个人在移动,还理解移动的“原因”和“方式”。

结果令人印象深刻。在测试诸如将文本转化为舞蹈、将语音转化为手势或预测一个人下一步动作等任务时,OmniMotion-X 的表现优于所有以往的方法。它不仅仅是产生随机的挥舞;它创造出的动作具有连贯性、真实感,并且可以长时间持续而不崩溃。例如,如果你要求它根据一首歌生成舞蹈,它不会只是随机移动,而是会配合节拍同步脚步。如果你给它一个“参考动作”(比如一段走路的片段),它可以无缝地延续那段行走,或者根据新的指令改变行走方式,同时保持风格和流畅度。

然而,创作者们也坦诚地说明了他们的机器人目前还不能做什么。虽然它在处理单个人的动作方面表现出色,但在处理需要与复杂物体或他人进行现实互动(例如拿起杯子而不掉落,或与朋友击掌)的任务时仍显吃力。此外,它的速度也有点慢,生成单个样本大约需要 2.14 秒,比一些更简单的模型要慢。但本文证明了,通过统一不同类型的数据并以智能的循序渐进的方式教导模型,我们可以更接近于创造出动作如真人般优雅且复杂的数字人类。这虽然还不是一个已解决的问题,但它是我们在教机器跳舞、做手势和随我们一起移动方面迈出的巨大一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →