← 最新论文
💻 computer science

MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer

本文提出了 MotionGrounder,一种基于扩散变换器(DiT)的框架,首次实现了多对象视频的运动迁移,通过流运动信号(FMS)提供稳定先验、对象 - 字幕对齐损失(OCAL)实现空间定位,并引入新的对象定位评分(OGS)指标,在定量、定性及人工评估中均显著优于现有基线方法。

原作者: Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim

发布于 2026-04-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 MotionGrounder 的新工具,它的核心能力可以概括为:“让视频里的多个角色,既能跳着参考视频里的舞,又能穿上你指定的新衣服,还能乖乖待在它该待的位置上。”

为了让你更容易理解,我们可以把视频生成想象成**“排演一场舞台剧”**。

1. 以前的难题:混乱的排练室

在 MotionGrounder 出现之前,现有的 AI 视频生成工具(就像以前的导演)面临两个大麻烦:

  • 只能管“独角戏”:以前的工具如果参考一段“一个人走路”的视频,它只能生成一个走路的人。如果你想要“狼、熊和兔子”三个角色一起互动,它往往就晕头转向了,要么只生成一个,要么把三个角色混成一团浆糊。
  • 指鹿为马:即使它勉强生成了多个角色,它也分不清谁是谁。比如你输入“狼在跑,兔子在跳”,它可能让兔子去跑,狼去跳,或者让狼跑到了兔子的位置上。这就好比你让演员 A 演国王,演员 B 演骑士,结果上台后,骑士穿着国王的袍子,国王拿着骑士的剑,完全乱套了。

2. MotionGrounder 的解决方案:一位超级导演

MotionGrounder 就像一位拥有“超能力”的超级导演,它通过两个核心“法宝”解决了上述问题:

法宝一:光流运动信号 (FMS) —— “精准的舞蹈动作捕捉器”

  • 比喻:想象参考视频里的角色在跳一支复杂的舞。以前的工具可能只记得“大概要动”,结果跳出来动作僵硬或者乱飘。
  • 作用:MotionGrounder 使用了一种叫“光流”的技术,就像给参考视频里的每个动作都贴上了**“隐形的高精度 GPS 轨迹”**。它能精确地记录下每个像素点是怎么移动的。
  • 效果:当它生成新视频时,它会严格照着这些 GPS 轨迹来指挥新角色跳舞。不管新角色是变成了机器人还是外星人,它们跳舞的动作节奏、方向、幅度都和参考视频里的一模一样,非常丝滑。

法宝二:对象 - 文案对齐损失 (OCAL) —— “严格的座位安排表”

  • 比喻:这是 MotionGrounder 最厉害的地方。以前的导演只管“动”,不管“谁在哪”。MotionGrounder 则像一位拿着座位表的场务
  • 作用:当你输入“狼在左边,兔子在右边”时,OCAL 会死死地盯着屏幕,确保:
    1. 必须出现在左边的区域。
    2. 兔子必须出现在右边的区域。
    3. 如果狼跑到了兔子该坐的位置,AI 会立刻“打醒”自己,把它推回原位。
  • 效果:它强行把“文字描述”和“画面位置”锁死在一起。无论场景怎么变,狼永远在狼该在的地方,兔子永远在兔子该在的地方,绝不会出现“张冠李戴”的尴尬。

3. 它是怎么工作的?(零样本、免训练)

  • 不用重新上学:很多 AI 工具需要针对新任务重新训练很久(就像学生要重新读几年书)。MotionGrounder 是**“零样本” (Zero-shot)** 的,意味着它不需要重新训练,直接就能用。
  • 即插即用:它像一个即插即用的插件,直接安装在现有的强大视频生成模型(Diffusion Transformer)上。你给它一个参考视频和一段新文字,它就能立刻开始工作。

4. 实际效果有多好?

论文里展示了很多惊人的例子:

  • 场景一:参考视频是“士兵走向坦克”。MotionGrounder 可以生成“宇航员走向月球登陆器”,而且宇航员的走路姿势和士兵一模一样,同时宇航员稳稳地走在月球表面,没有飘走。
  • 场景二:参考视频是“狐狸和浣熊在树干上”。它可以生成“机器人狗和机器人小孩在霓虹平台上”,并且机器人狗和机器人小孩的位置、互动方式完全对应原来的狐狸和浣熊。
  • 多角色互动:它能同时处理狼、熊、兔子三个角色,让它们在草地上互动,互不干扰,动作自然。

5. 总结

简单来说,MotionGrounder 就是给 AI 视频生成加上了**“多角色管理能力”“精准定位能力”**。

  • 以前:AI 生成视频像是一个喝醉的舞者,动作乱飞,分不清谁是谁。
  • 现在:MotionGrounder 像是一个训练有素的编舞家,它不仅能完美复刻复杂的舞蹈动作(运动转移),还能确保每个演员(对象)都站在正确的舞台位置(空间定位),并且穿着你指定的戏服(文本描述)。

这项技术对于电影制作、游戏开发、教育演示等领域非常有价值,因为它让创作者可以低成本、高效率地生成复杂且可控的多角色动态视频。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →