← 最新论文
💻 computer science

DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding

DiMo 引入了一个统一的离散扩散框架,将掩码建模扩展到双向文本-运动理解与生成,通过迭代式标记细化、残差向量量化和组相对策略优化,实现了灵活的质量-延迟权衡以及多样化的运动任务。

原作者: Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一本巨大的、神奇的速写本。在过去,如果你想根据一段描述来画一个跳舞的人,或者根据一段舞蹈视频来写一个故事,你必须使用两个不同的速写本,或者使用一个非常僵化的速写本,它只能一次画一笔,从左到右。如果你在第一笔时犯了错,整幅画就毁了,而且你无法轻松地回头修正,而不必重新开始。

DiMo 是一种全新的“智能速写本”,它改变了规则。它是一个能够同时做两件事的单一系统:

  1. 阅读描述并绘制动作(文本生成动作,Text-to-Motion)。
  2. 观看动作并编写描述(动作生成文本,Motion-to-Text)。

以下是它的工作原理,我使用了日常生活的类比:

1. “模糊照片”游戏(它是如何生成的)

大多数旧方法的工作方式就像一个人一次写一个词。一旦写下一个词,就无法更改。如果他们写了“小狗跑了”,他们很难在不重写整个句子的情况下将“跑了”改为“跳了”。

DiMo 的工作方式不同。 想象你有一张舞者的照片,但它完全被静态噪声覆盖了(就像一个充满雪花点的模糊电视屏幕)。

  • 过程: DiMo 并不不是逐笔绘制舞者。相反,它会一次性观察整个模糊的图像。它会猜测舞者的样子,然后猜测“下一个版本”应该是什么样子的,并不断重复这个细化过程。
  • 魔力所在: 它可以在图像的任何地方瞬间修复错误。如果左臂看起来很奇怪,它可以只修复左臂,而不会弄乱右腿。它通过在并行步骤中进行“去噪”来实现这一点,就像不断锐化一张模糊的照片,直到它变得清晰无比。

2. “速度 vs 质量”旋钮

因为 DiMo 是通过步骤来细化图像的,所以你可以选择生成结果的速度。

  • 需要快? 你可以提前停止过程(比如在第 5 步时)。舞者的样子会显得有些粗糙,但你能立即得到结果。
  • 需要完美? 你可以让它运行更多步骤(比如 30 步)。舞者看起来会非常逼真且流畅。
    这就像一个带有“速度 vs 质量”旋钮的相机。你可以滑动它,以获得你在特定时刻所需要的结果。

3. “高清晰度”翻译器 (RVQ)

为了让舞者看起来真实,DiMo 使用了一个特殊的工具,叫做残差向量量化 (Residual Vector Quantization, RVQ)

  • 类比: 想象你试图仅用 10 种颜色来描述一幅复杂的画作。它看起来会很块状且丑陋。现在想象你有一个拥有 1,000 种颜色的调色板,但你分层使用它们。首先,你铺设大的形状(身体),然后你添加肌肉,最后添加像发丝这样微小的细节。
  • 结果: DiMo 将动作分解为这些层级。这使得它能够分别捕捉“粗略”的动作(如行走)和“精细”的细节(如手指的抽动),从而产生更平滑、更真实的动画。

4. “智能教练” (GRPO)

有时,即使动作看起来很好,它可能也与你告诉它的故事不符(例如,文本说“跳跃”,但角色却在“行走”)。

  • 类比: DiMo 有一个内置的“教练”(称为 GRPO)。在 DiMo 完成一次动作后,教练会检查:“这符合文本吗?”如果不符合,教练会给系统一个轻微的提示,让它重试。随着时间的推移,DiMo 会学会更好地听从教练,确保舞蹈与故事完美契合。

它究竟能做什么?

根据论文,DiMo 是处理动作和文本的瑞士军刀:

  • 文本生成动作: 你输入“一个人正在做后空翻”,它就会生成视频。
  • 动作生成文本: 你上传一段舞蹈视频,它会写出类似“舞者正在旋转并跳跃”的标题。
  • 修复错误: 如果你的视频有一个缺失的部分(比如中间有一段断开),DiMo 可以填补这个缺口,而不需要新的指令。
  • 修正标题: 如果你有一个视频和一个不太匹配的标题,DiMo 可以修正标题以准确描述正在发生的事情。

总结

论文声称 DiMo 比以往的方法更好,因为它不会卡在开头的一个错误上。它可以观察全局,在任何地方修复错误,并让你选择生成速度或质量的高低。它已在标准数据集(HumanML3D 和 KIT-ML)上进行了测试,证明它可以在一个统一的框架内创建高质量的舞蹈并编写准确的描述。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →