← 最新论文
💻 computer science

The Quest for Generalizable Motion Generation: Data, Model, and Evaluation

本文提出了一个从视频生成领域迁移知识到人体运动生成的综合框架,通过构建大规模混合数据集 ViMoGen-228K、设计基于流匹配的扩散 Transformer 模型 ViMoGen 及其轻量化版本,并建立分层评估基准 MBench,显著提升了运动生成模型的泛化能力。

原作者: Jing Lin, Ruisi Wang, Junzhe Lu, Ziqi Huang, Guorui Song, Ailing Zeng, Xian Liu, Chen Wei, Wanqi Yin, Qingping Sun, Zhongang Cai, Lei Yang, Ziwei Liu

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Jing Lin, Ruisi Wang, Junzhe Lu, Ziqi Huang, Guorui Song, Ailing Zeng, Xian Liu, Chen Wei, Wanqi Yin, Qingping Sun, Zhongang Cai, Lei Yang, Ziwei Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在解决一个“教机器人跳舞”的难题,但这次他们不想只教机器人跳广播体操,而是想让它学会跳各种各样的舞,甚至包括它从来没见过的“街舞”或“武术”。

简单来说,现有的 3D 动作生成模型(让文字变成动作的 AI)就像是一个只会背课本的优等生。它能把“走路”、“挥手”这些标准动作做得很完美,但如果你让它表演“像醉汉一样踉跄着去拿沙发上的遥控器”,它可能就傻眼了,或者动作做得很僵硬。

为了解决这个问题,作者团队(来自南洋理工大学、商汤科技等)提出了一套名为 ViMoGen 的全新方案,他们把整个过程比作**“三位一体”的升级计划**:

1. 数据篇:从“死记硬背”到“见多识广”

(ViMoGen-228K 数据集)

  • 以前的困境:以前的 AI 训练数据就像一本只有 100 页的字典,里面全是“跑步”、“跳跃”这种标准动作。AI 背得滚瓜烂熟,但遇到生僻词就卡壳。
  • 现在的突破:作者们收集了 22.8 万 个动作样本,把这本字典扩充成了图书馆
    • 高清动作捕捉(MoCap):这是“专业教练”教的动作,非常精准,但动作比较单一(就像在摄影棚里跳舞)。
    • 野外视频提取:这是从互联网海量视频里“偷师”来的动作,虽然有点模糊(像手机拍的),但涵盖了“在泥地里打滚”、“在拥挤地铁里躲闪”等真实场景。
    • AI 合成视频:这是最绝的一招!他们先用最先进的视频生成 AI(能根据文字生成视频的大模型)生成一些很难拍到的动作视频(比如“像超人一样飞”),然后再把这些视频里的动作“翻译”成 3D 数据。
  • 比喻:以前 AI 只看过教科书;现在它既看了教科书,又看了纪录片,还看了科幻电影,所以它什么动作都能模仿。

2. 模型篇:请了个“双核大脑”

(ViMoGen 模型)

  • 以前的困境:以前的模型只有一个大脑,要么太死板(只信教科书),要么太飘忽(只信视频,动作容易变形)。
  • 现在的突破:作者设计了一个**“双核智能系统”,就像给机器人装了两个大脑,并且有一个智能开关**:
    • 大脑 A(文字转动作):负责处理精准的动作。当你说“做一个标准的深蹲”时,它调用这个大脑,保证动作物理上合理,不会穿模(手穿过身体)。
    • 大脑 B(视频转动作):负责处理复杂的、没见过的动作。当你说“像喝醉了一样在冰面上滑行”时,它参考视频里的感觉,让动作更生动、更有创意。
    • 智能开关(门控机制):这是核心!AI 会先判断:“这个指令,视频里的参考靠谱吗?”
      • 如果靠谱(比如“跳舞”),就主要用大脑 B,让动作更灵活。
      • 如果不靠谱(比如视频里的人摔倒姿势很怪),它就立刻切换回大脑 A,用文字指令生成一个稳健的动作。
  • 比喻:这就像你学做菜。以前你只能照着菜谱(文字)做,味道很标准但没灵魂。现在你有个老厨师(视频参考)在旁边看着,但老厨师有时候也会看错。于是你有个智能助手,如果老厨师看对了,你就学他的花样;如果老厨师看错了,你就立刻回到菜谱,保证菜不会做糊。

3. 评估篇:不再只看“像不像”,要看“神不神”

(MBench 评测标准)

  • 以前的困境:以前的评测就像只给作文打分,只看字数够不够、有没有错别字(比如动作是否流畅),但不管内容是否切题。
  • 现在的突破:作者建立了一个**“全方位考官” (MBench)**。
    • 它不仅看动作流不流畅(质量),还要看动作有没有听懂人话(比如你说“愤怒地踢腿”,它不能温柔地踢)。
    • 最重要的是,它专门考**“偏题”**:给一些 AI 从来没见过的指令(比如“像企鹅一样在冰上滑行”),看 AI 能不能举一反三。
  • 比喻:以前的考试是选择题,AI 只要背答案就能拿高分。现在的 MBench 是开放式问答,甚至出脑筋急转弯,专门测试 AI 的“悟性”。

总结:为什么这很重要?

这就好比以前我们只能让机器人跳广播体操,动作标准但呆板。现在,通过这套方法,我们终于能让机器人即兴表演了。

  • ViMoGen 是那个聪明的机器人,它能听懂“像喝醉了一样”这种复杂的描述。
  • ViMoGen-light 是它的轻量版,去掉了那个需要实时生成视频的“累赘”,让它在手机或普通电脑上也能跑得飞快,但依然很聪明。
  • MBench严格的考官,确保它真的学会了,而不是在作弊。

这项研究不仅让动画制作、游戏开发、虚拟人互动变得更真实、更有趣,也为未来打造真正的**“通用动作大模型”**(能理解人类所有行为的 AI)打下了坚实的基础。简单说,就是让机器从“只会做操的机器人”进化成了“懂人类行为的智能伙伴”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →