← 最新论文
💻 computer science

GestureFM : Compact Latent Flow Matching for Low-Latency Co-Speech Body-Motion Generation

GestureFM 是一个紧凑的潜在流匹配(latent Flow Matching)框架,它通过将 SMPL-X 姿态压缩到潜在空间并采用轻量级平滑器来解决块边界处的间断问题,从而实现低延迟、高质量的流式共语体态动作生成,在实现极低首块延迟的同时达到了具有竞争力的动作质量。

原作者: Jie Liu, Tianmei Sun, Zian Liu

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jie Liu, Tianmei Sun, Zian Liu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在和一位朋友聊天,在说话的同时,你的手、手臂和身体会随着你的言语自然地舞动。这被称为“言语伴随手势”(co-speech gesture),它是人类交流中极其重要的一部分。现在,想象一个视频游戏角色或虚拟助手也想做到这一点。挑战在于,计算机需要倾听你的声音,理解你在说什么,并立即移动角色的身体以与之匹配。但问题在于,如果计算机要等到你把整句话说完才开始动作,这个角色看起来就会像是一个总是慢半拍的机器人。为了显得真实,角色需要在你说话的过程中就开始移动。这就是“低延迟流式生成”(low-latency streaming generation)的世界——让数字人实现无延迟的实时动作。

为了实现这一点,科学家们使用了特殊的数学技巧。其中一个技巧叫做“变分自编码器”(Variational Autoencoder, VAE),它就像一个超高效的压缩应用。它将庞大且复杂的 3D 身体运动压缩成一个微小、简单的代码(即“潜空间”),这使得计算机处理起来更加容易。另一个技巧是“流匹配”(Flow Matching),它就像是从一个随机的涂鸦画出一条既直又平滑的线,最终变成一幅完美的画作。流匹配不是像一个模糊的艺术家那样一步步去猜测图像,而是学习要走的精确路径,从而让计算机能够非常快速地绘制出最终图像。研究人员试图解决的核心问题是:我们能否结合这些工具,让虚拟人的动作如此快速且流畅,以至于在说话的同时,让人感觉它真的就在那里?

于是,一项名为 GestureFM 的新研究诞生了,它试图回答这个问题。研究人员 Jie Liu、Tianmei Sun 和 Zian Liu 构建了一个旨在以几乎零延迟生成身体动作的系统。他们之所以将系统命名为“GestureFM”,是因为它在压缩的“潜空间”内使用了这种“流匹配”魔法。

以下是他们的系统是如何工作的,我们用一个简单的类比来说明:想象你正试图通过电话向朋友描述一段舞蹈,但你每次只能发送 1 秒钟的语音片段。你的朋友必须根据目前听到的声音立即开始跳舞。GestureFM 就是那个极其擅长此道的“朋友”。首先,它使用一个“手势 VAE”(Gesture VAE)将人类身体复杂的 168 维运动(例如你所有关节的角度)转化为一个仅有 44 个 token 的微小代码。这就像是将一部长篇电影浓缩成几张快速的速写笔记。然后,一个“音频调节的流匹配 Transformer”(audio-conditioned Flow Matching Transformer)会倾听你的声音(具体来说是被称为 Log-Mel 特征的声音模式),并利用这些速写笔记来绘制下一秒的动作。

他们发现的最令人兴奋的部分是其速度和效率。团队发现,他们生成第一块运动数据仅需 22 毫秒。为了让你有个直观的概念,这仅为实时速度的 0.022 倍。这意味着计算机的工作速度大约是现实生活的 45 倍,为动作在你说完话的同时即时发生留出了充足的空间。

他们还测试了计算机需要走多少个“步骤”来绘制动作。在许多 AI 系统中,增加步骤通常意味着更好的画面但更慢的速度。然而,GestureFM 有一个惊人的发现:增加步骤实际上并没有让动作看起来更好。无论他们是走 2 步还是 32 步,运动的质量(通过名为 Fréchet Gesture Distance 或 FGD 的评分来衡量)几乎保持完全一致。因此,他们建议使用仅 2 步(K=2)即可在不损失任何质量的前提下获得最快的速度。

但也有一个小瑕疵。由于系统是以 1 秒为一个块进行生成的,块与块之间的过渡有时会显得有些生硬,就像视频在瞬间卡顿一样。为了修复这个问题,他们添加了一个“7 帧局部平滑器”(7-frame local smoother)。你可以把它想象成一个微小的剪辑师,它能温柔地将上一秒运动的结尾与下一秒运动的开头融合在一起。这个简单的修复方法将“速度跳变”(velocity jump,即突然的生硬感)降低了 85%,使动作变得更加流畅,同时不会破坏动作与音乐之间的节奏配合。

研究人员还测试了其他一些想法,以看看是否能做得更好,但他们排除了其中一些。例如,他们尝试通过将前一个运动块的结尾传递给下一个运动块来赋予系统“记忆”。不幸的是,这使得运动质量大幅下降(FGD 分数从 0.253 跳升至 1.740)。他们意识到,这是因为系统是在完美的现实世界运动数据上进行训练的,但在测试时,当它尝试使用自己的“记忆”时,会被自己的错误所迷惑。因此,他们决定目前最好保持每个块的独立性,并仅使用平滑技巧来处理边缘。

最后,GestureFM 表明,无需等待整句话说完,你就可以创建高质量、低延迟的虚拟人身体动作。通过压缩数据、使用流匹配并添加简单的平滑滤波器,他们实现了一个既极其快速(22 毫秒延迟)又非常准确的系统,能够完美契合语音的节奏。这是迈向让数字人不仅能说话,还能在实时交互中真正与我们律动的关键一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →