← 最新论文
💻 computer science

TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation

TeMuDance 提出了一种无需人工标注的“音乐 - 文本 - 动作”三元组数据集即可实现音乐驱动舞蹈生成的文本控制框架,该框架通过以动作为语义锚点桥接异构数据、设计双流微调策略抑制噪声,并引入任务对齐指标,在保持舞蹈节奏真实性的同时显著提升了基于自然语言描述的细粒度语义控制能力。

原作者: Xinran Liu, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinran Liu, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 TeMuDance 的新系统,它的核心目标是解决一个让虚拟舞者“既懂音乐,又听人话”的难题。

为了让你更容易理解,我们可以把整个系统想象成在培养一位顶级的虚拟舞蹈家

1. 以前的困境:只有“乐感”,没有“语感”

在 TeMuDance 出现之前,现有的虚拟舞者主要有两个问题:

  • 懂音乐,但不懂指令:它们能跟着音乐节奏跳得很嗨(比如跟着爵士乐摇摆),但你如果对它说“向左走”或者“踢右腿”,它们完全听不懂,或者跳得很生硬。
  • 懂指令,但不懂音乐:有些系统能听懂“踢腿”的指令,但跳出来的动作往往和音乐节奏对不上,像是在乱跳。

根本原因是什么?
这就好比你想教一个学生既懂乐理又懂外语,但你手头只有两本分开的书:

  1. 一本是《音乐与舞蹈》(只有音乐和动作,没有文字描述)。
  2. 一本是《动作与文字》(只有文字描述和动作,没有音乐)。
    你从来没有见过一本《音乐 + 文字 + 动作》的“三合一”教科书。 以前的模型因为缺乏这种“三合一”的数据,所以无法同时学会这两项技能。

2. TeMuDance 的绝招:用“动作”当翻译官

TeMuDance 的聪明之处在于,它不需要那本不存在的“三合一”教科书。它发明了一种**“以动作为中心”的桥接法**。

想象一下这个场景:

  • 动作(Motion) 就像是一个通用的翻译官
  • 系统先让“翻译官”去读《音乐与舞蹈》那本书,记住:“哦,当听到这种鼓点时,动作应该是‘旋转’。”
  • 然后,它又让“翻译官”去读《动作与文字》那本书,记住:“哦,当看到‘旋转’这个动作时,文字描述应该是‘转圈’。”
  • 神奇的时刻来了:现在,当你给系统输入一段音乐和一个文字指令(比如“在爵士乐中向左转”),系统不需要直接翻译,而是通过“动作”这个中间人:
    1. 音乐 -> 翻译成“旋转动作”。
    2. 文字“向左转” -> 也翻译成“旋转动作”。
    3. 既然两者都指向同一个“动作”,系统就能把它们完美地融合在一起,生成既符合音乐节奏、又执行了文字指令的舞蹈。

3. 它是怎么训练的?(双管齐下)

为了让这个“翻译官”更靠谱,TeMuDance 采用了两个策略:

  • 冻结的“老教师” + 灵活的“新助教”

    • 系统先训练一个非常厉害的“老教师”(音乐转舞蹈模型),它已经能把音乐跳得很完美了。我们冻结住它,不让它乱动,保证舞蹈的节奏感和物理真实性(比如脚不会穿模)。
    • 然后,我们给它配一个**“新助教”**(文字控制分支)。这个助教很轻,专门负责听你的文字指令,并悄悄地在“老教师”跳舞的过程中,微调它的动作方向。
    • 比喻:就像一位经验丰富的老舞者(老教师)在跳舞,旁边有个导演(新助教)拿着扩音器喊:“向左一点!踢高一点!”老舞者依然保持节奏,但动作细节完全听从导演的指挥。
  • 双重过滤,去伪存真

    • 因为系统是用两本分开的书“猜”出来的三合一数据,里面难免会有猜错的时候(比如把“走路”猜成了“跑步”)。
    • TeMuDance 设计了一套**“信心过滤器”**。如果系统觉得某次“猜”出来的动作和文字/音乐匹配度不高,它就果断扔掉,只保留高质量的“猜测”来训练。这就像老师批改作业,只把做对的题留下来强化记忆,做错的题先放一边,避免教坏学生。

4. 怎么判断它跳得好不好?(KPS 指标)

以前的评价标准通常是看“动作像不像真人”或者“跟音乐合不合拍”。但 TeMuDance 发明了一个新指标叫 KPS(动作原语成功率)

  • 比喻:以前是请评委看“这舞跳得漂不漂亮”。
  • 现在:是请评委做“判断题”。比如你输入“踢右腿”,系统跳完后,评委直接检查:“它的右腿真的踢出去了吗?”
    • 如果踢出去了,得一分。
    • 如果没踢,或者踢的是左腿,不得分。
    • 这个指标能直接告诉你:你的文字指令到底有没有被真正执行。

5. 总结:TeMuDance 带来了什么?

简单来说,TeMuDance 就像给虚拟舞者装上了一个**“超级大脑”**:

  1. 不用死记硬背:它不需要那种完美的“音乐 - 文字 - 动作”三合一数据,靠“动作”这个桥梁就能学会。
  2. 既稳又灵:它跳出来的舞,节奏感依然完美(像专业舞者),但又能精准地听懂你“向左走”、“转圈”、“挥手”等具体指令。
  3. 无缝融合:它不会像以前的方法那样,先跳一段舞,中间突然停顿一下去执行指令,然后再继续跳。它是把指令自然地编织进舞蹈的每一个节拍里。

一句话总结:TeMuDance 让虚拟舞者从“只会跟着音乐瞎跳的机器人”,变成了“既能听懂音乐节奏,又能精准执行你每一个指令的聪明舞者”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →