← 最新论文
💻 computer science

DiscoForcing: A Unified Framework for Real-Time Audio-Driven Character Control with Diffusion Forcing

DiscoForcing 是一个统一的实时框架,它利用因果音乐编码器和具有混合时间调度的扩散强制序列模型,在严格延迟约束和非平稳音频条件下,实现稳定、长时程且响应灵敏的全身角色运动控制。

原作者: Kaiyang Ji, Bingsheng Qian, Binghuan Wu, Kangyi Chen, Ye Shi, Jingya Wang

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaiyang Ji, Bingsheng Qian, Binghuan Wu, Kangyi Chen, Ye Shi, Jingya Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人随着收音机里实时播放的音乐跳舞。棘手之处在于音乐是实时流式传输的:节拍可能会突然加速,歌曲可能会切换风格,或者 DJ 可能会刮擦唱片。机器人必须对这些变化做出即时反应,但同时它也需要保持舞蹈流畅,避免绊倒自己的脚,或忘记几秒钟前的节奏。

这就是DiscoForing所要解决的问题。它是一个新系统,能让数字角色(或真实机器人)实时跟随现场音乐起舞,对每一个节拍重音和速度变化做出反应,而不会滞后。

以下是其工作原理,分解为简单的概念:

1. 问题:“离线”与“实时”之间的差距

大多数以往的舞蹈 AI 系统就像电影导演。它们在决定角色如何移动之前,会先观看整首歌曲从头到尾。它们知道副歌即将到来,因此可以为此做好准备。

但在真实的互动游戏或现场表演中,你无法等待整首歌曲结束。你必须像爵士乐即兴演奏者一样。你听到一个音符,立即做出反应,并且即使音乐发生意外变化,也必须继续演奏。如果 AI 等待“向前看”,它会显得迟钝;如果它反应过快而不回顾过去,它就会开始抖动并失去节奏。

2. 解决方案:“扩散强制”引擎

DiscoForcing 使用了一个巧妙的技巧,称为扩散强制(Diffusion Forcing)。这就像一位智能编辑正在处理视频流。

  • 旧方法: 想象试图通过一次性查看整张图片来修复一张模糊的照片。如果你只有一半的图片(因为音乐还在播放),你会感到困惑。
  • DiscoForcing 方法: 想象 AI 不断地“清理”它刚刚做出的舞蹈动作,但它是以一种特殊的方式进行的。它将近期过去(最近几秒的音乐)视为非常清晰且重要,而将遥远的过去视为有点“模糊”或充满噪声。
    • 这使得 AI 能够信任近期的音乐,从而对突然的节拍重音做出快速反应。
    • 同时,它保持遥远的历史足够稳定,以免舞者开始失控旋转。

这就像开车:你锐利地注视正前方的道路以避开坑洼(对新的音乐做出反应),但你的手根据过去一分钟的行驶轨迹稳稳地握着方向盘(维持流畅性)。

3. 双部分大脑

该系统有两个主要部分协同工作:

  • 耳朵(因果音乐编码器):在音乐发生时聆听。它不会窥探未来。它将音乐分解为两件事:
    1. 节拍: 一个数字“敲击”,告诉舞者何时迈步。
    2. 流动: 一个平滑的信号,告诉舞者移动得快还是慢。
  • 身体(动作生成器): 它接收“节拍”和“流动”信号,并将它们转化为舞蹈动作。它使用潜在变分自编码器(Latent VAE)(一种压缩工具)将复杂的 3D 身体运动转化为简单、紧凑的代码。这使得数学运算速度足够快,可以实时运行而不会导致计算机冻结。

4. “混合”策略

该论文引入了一种“混合时间调度”。这就像 AI 记忆的调光开关

  • 当音乐平稳时,AI 更多地依赖它对几秒钟前所做动作的记忆,以保持舞蹈流畅。
  • 当音乐突然变化(例如歌曲中的突然重音)时,AI“调暗”对过去的记忆,并“调亮”对新音乐的专注,使其能够瞬间切换到新的节奏。

5. 现实世界测试:从屏幕到机器人

作者不仅是在电脑屏幕上测试了这一点;他们构建了一个完整的系统,以证明其在现实世界中的有效性。

  • 虚拟化身: 他们将系统连接到视频游戏引擎(Unity)中,其中的数字角色会随着你播放的任何音乐实时跳舞。
  • 真实机器人: 他们还将舞蹈动作发送给了一个物理机器人(Unitree G1 人形机器人)。该机器人成功接收了 AI 的舞蹈指令并实际执行了这些动作,随着音乐的变化调整其平衡和步伐。

总结

DiscoForcing 是一个系统,它通过平衡两个相互竞争的需求来教会角色跟随现场音乐跳舞:快速反应新的节拍,以及保持流畅以免舞蹈看起来生硬。它通过一种特殊的“模糊记忆”技术来实现这一点,该技术让 AI 能够专注于当下时刻,同时仍然记住歌曲的整体流动,同时运行速度足够快,能够跟上实时收音机流。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →