← 最新论文
💻 computer science

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

该论文介绍了 Wan-Dancer,这是一种新颖的分层框架,通过将全局关键帧规划与局部时间细化解耦,克服了现有扩散模型在时间维度上的局限性,从而能够直接根据音乐生成分钟级、高清晰度(720p/30fps)且节奏连贯的舞蹈视频。

原作者: Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Bang Zhang

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Bang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你试图为一整首歌编排舞蹈,但你的大脑只能记住大约 15 秒的动作,之后就开始出现故障、忘记舞者的脸,或者让他们被自己的脚绊倒。这就是目前大多数 AI 舞蹈生成器的现状。它们擅长短促的爆发,但只要你要求进行一分钟的表演,视频就会开始晃动,舞者的身份会闪烁,节奏也会崩塌。

迎来 Wan-Dancer,这是来自阿里巴巴通义实验室的一个新框架,它就像一位拥有超能力的舞蹈大师:它可以从头到尾规划整场舞蹈,而不会失去冷静。

问题所在:“短时记忆”导致的“失忆症”

目前的 AI 模型就像是患有短期记忆障碍的舞者。如果你要求它们跳 20 秒,它们看起来很棒。但如果你把要求推向 60 秒或更长,它们就会遭受“时间漂移(temporal drift)”。这意味着舞者在歌曲开始时可能看起来像个流行明星,但在结束时却变成了完全不同的人,或者他们的动作变得重复且机械化。以前的方法试图通过拼接短片段来修复这个问题,但这就像是用胶带把电影胶片粘在一起;你总能看到接缝,故事也会因此支离破碎。

解决方案:“全局规划者”与“局部舞者”

Wan-Dancer 通过将工作拆分为两个截然不同的角色,并让它们在一个层级化的团队中协作,从而解决了这个问题:

  1. 全局规划者(大局观): 首先,AI 会一次性观察整首歌曲。它不仅仅是猜测下一个动作,而是规划出贯穿整分钟舞蹈的“关键帧(keyframes)”——即主要的姿态和结构性时刻。这就像是在铺设第一块砖之前,建筑师先绘制摩天大楼的蓝图。这确保了舞者在跳第 5 秒的舞时,就已经知道自己在第 50 秒将会处于什么位置。
  2. 局部精炼器(细节): 一旦蓝图设定好,系统的第二个部分就会填充间隙。它利用这些关键姿态并在其间生成平滑的高清帧。这就是流畅动作产生魔力的地方,确保舞者不会在姿态之间发生“瞬间移动”,而是优雅地穿梭于空间之中。

核心秘诀:三个酷炫的技巧

为了实现这一点,研究人员在他们的工具箱中加入了三个特定的工具:

  • 时光旅行时钟(动态帧率): 音乐并不总是速度一致的。有时是慢节奏的情歌,有时是快速的电音。Wan-Dancer 使用了一种特殊的“时间映射”时钟(称为 RoPE 嵌入),它能准确告诉 AI 已经过去了多少时间,无论生成的每秒帧数是多少。这使得 AI 能够完美同步 3 秒的节拍或 10 秒的慢动作拉伸,而不会感到困惑。
  • 运动模糊护盾(光流损失): 当舞者快速旋转时,画面会变得模糊。旧的 AI 模型只会让图像变得模糊,把手变成一个色块。Wan-Dancer 使用了“光流(optical flow)”损失函数。想象一下这是一个严格的老师,他逐帧检查视频,以确保动作完全对齐。如果 AI 在快速旋转期间试图模糊细节,老师会说:“不对,修好那只手,”从而确保舞者即使在高速运动下依然清晰锐利。
  • 速度调节器(动作控制): 该系统经过训练,可以分别处理慢速、中速和快速动作。它学到了“中速”通常是人类舞蹈的最佳平衡点,从而防止 AI 做出过慢(乏味)或过快(物理上不可能且充满故障)的动作。

成果:一分钟的魔力

团队在约 200 小时的高质量舞蹈视频数据集上进行了测试,涵盖了五种截然不同的风格:中国古典舞、K-Pop、拉丁舞、踢踏舞和街舞

结果令人印象深刻。Wan-Dancer 可以生成稳定的 720p 分辨率30 帧/秒 的视频,时长可超过一分钟(具体而言,他们展示了高达 160 秒 的效果)。

  • 身份一致性: 舞者从第一秒到最后一秒看起来都是同一个人。
  • 节奏感: 动作完美契合音乐节拍。
  • 多样性: 它可以根据简单的文本提示(如“一名舞者正在表演拉丁舞”)在不同舞蹈风格之间切换。

他们还展示了你可以仅使用 16 段参考视频 和一种称为 LoRA(低秩自适应)的技术来教 AI 一套特定的舞步。这意味着你可以让 AI 模仿特定的编舞,而无需从头开始重新训练整个系统。

它还不是什么(以及未来方向)

需要注意的是,Wan-Dancer 目前还做不到什么。它不会生成需要后期渲染的 3D 骨架;它直接生成视频。然而,作者承认它并不完美。

  • 面部一致性: 虽然身体保持一致,但面部在极长的序列中仍可能出现轻微闪烁。他们计划在未来解决这个问题。
  • 群舞: 目前,它还只是一个独舞表演。他们希望教会它如何编排多个舞者相互互动的群舞。
  • 伦理: 团队非常明确:这是为了创造艺术,而不是制作假新闻或深度伪造(deepfakes)。他们承诺所有输出都将清晰标注为 AI 生成。

简而言之,Wan-Dancer 表明,通过将一个大问题分解为“大局规划”和“细节执行”,我们终于可以让 AI 随着整首歌起舞而不掉节拍。这是向前迈出的重要一步,让我们从 15 秒的片段跨越到了真正看起来像真人跳舞的完整分钟级表演。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →