← 最新论文
💻 computer science

FlowDance: Music-Driven Dance Video Generation with Parallel Pose and RGB Streams

本文提出了 FlowDance,这是一个通过整合并行姿态与 RGB 流,并结合用于动作和身份保持的专门注入技术,来生成音乐驱动舞蹈视频的框架,该框架得到了一个新策划的高分辨率舞蹈数据集的支持。

原作者: Genying Li, Boda Lin, Jiachen Li, Zijian Jia, Haojie Zheng, Yiming Wang, Shuchen Weng, Si Li

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Genying Li, Boda Lin, Jiachen Li, Zijian Jia, Haojie Zheng, Yiming Wang, Shuchen Weng, Si Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

音乐与动作之间长期以来一直存在着一种深刻且无需言说的对话。当节奏响起时,身体往往会在大脑还没来得及命名节拍之前就做出反应。几十年来,科学家和工程师一直试图教会计算机理解这种联系,希望创造出能够观看一首歌并发明与之匹配的舞蹈的机器。早期的尝试侧重于动作本身的骨架,创建能够随着旋律跳跃和旋转的数字火柴人。虽然这些系统可以生成运动的基本形状,但它们无法捕捉到表演者的神韵。它们缺乏特定的面孔、独特的服装以及让舞者看起来像真实人类而非线条集合的细微细节。挑战在于如何弥合抽象舞蹈概念与特定人物随音乐运动的视觉现实之间的鸿隙,同时还要确保整个视频过程流畅且令人信服。

现在,一个研究团队开发了一个名为 FlowDance 的新系统,通过改变计算机处理任务的方式来应对这一挑战。该系统不再试图通过一个巨大的步骤完成所有工作,也不再将过程分解为相互脱节的独立阶段,而是通过两个并行的信息流进行运作。一个流专注于动作的结构,创建一个舞者姿态的简化视频;而另一个流则专注于视觉外观,生成人物的实际视频。这两个流在视频生成过程中不断地进行交流。结构流引导视觉流,确保人的肢体动作正确;而视觉流则确保舞者的面部和衣服在整个片段中保持一致。这种方法使系统能够生成一段特定个体随音乐自然起舞的视频,在保留其身份特征和服装细节的同时,避免了以往方法中常见的错误。

以往解决这一问题的尝试通常依赖于一系列独立的工具链。一个工具负责推测身体的 3D 形状,第二个工具尝试将该形状压平为 2D 图案,第三个工具则利用该图案绘制最终视频。研究人员发现,第一步中的误差会不断累积,导致生成的视频中舞者的肢体可能会突然拉长,身体可能会发生尺寸偏移,或者面部可能出现扭曲。其他方法尝试一次性完成所有工作,直接将音乐和照片映射到视频,但这往往会让动作显得僵硬或缺乏说服力,因为计算机必须同时解决过多复杂的难题。FlowDance 通过保持运动与图像生成既关联又独立的特性,避开了这些陷阱。它使用一个预训练的视频模型作为基础,然后添加一条专门的路径让音乐影响姿态,以及另一条路径来保持舞者的面部和身体与原始照片一致。

为了训练这个系统,研究人员从互联网上构建了一个庞大的舞蹈视频集,精心挑选了高质量且包含单人舞蹈的片段。他们收集了超过 16.5 万个时长为 5 秒的短片,并为它们添加了详细的标签。对于每一个视频,他们都记录了音乐、舞者的 3D 动作、摄像机角度以及关节的 2D 位置。他们将这个数据集命名为 FlowDanceSet,它让计算机能够学习音乐节奏与人类身体特定运动方式之间的关系,同时观察真实的人在运动时的样子。随后,该系统在从未见过的全新歌曲和新舞者上进行了测试。结果显示,FlowDance 生成的视频比目前其他方法更加流畅且真实。在将输出结果与其它系统制作的视频进行对比测试时,人类观察者一致认为 FlowDance 生成的视频更优,并指出其中的舞者看起来更自然,动作更流畅,且音乐与动作之间的联系更强。

该系统还引入了一种处理长视频的方法,使其不会丢失舞者的身份特征。随着视频变长,计算机往往难以记住这个人最初的样子,从而导致在时间推移过程中出现面部或服装发生轻微漂移的现象。FlowDance 通过在创作过程中的不同时间点,反复将舞者的原始照片反馈给系统来解决这个问题。这使得视觉细节得以锁定,从而允许系统生成持续数秒的序列,同时保持外观的一致性。研究人员发现,这种方法结合并行流,使得他们能够创造出即使在进行复杂且充满活力的动作时,舞者的服装、体型和面部特征依然保持稳定的视频。这项工作表明,通过将规划动作的任务与渲染图像的任务分离,但保持它们之间的持续沟通,便可以创造出既具有结构准确性又具有视觉说服力的舞蹈视频。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →