← 最新论文
💻 computer science

EchoMask: Speech-Queried Attention-based Mask Modeling for Holistic Co-Speech Motion Generation

本文提出了 EchoMask,这是一个通过采用运动-音频对齐模块和语音查询注意力机制,根据语音特征选择性地掩蔽具有语义显著性的运动帧,从而改进整体协同言语手势生成的创新框架,其性能超越了现有的最先进方法。

原作者: Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Jianqiang Ren, Liefeng Bo, Zhigang Tu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Jianqiang Ren, Liefeng Bo, Zhigang Tu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在计算机视觉领域,研究人员正不断尝试教会机器理解并重现人类的动作。一个特别具有挑战性的目标是生成“协同语音动作”(co-speech motion),即让数字角色能够与说话的内容完美和谐地配合肢体、手部和面部的动作。这不仅仅是让机器人挥手那么简单;它是要捕捉人类说话时那些微妙且无意识的姿态,比如人在愤怒时手部会紧绷,或者在犹豫不决时肩膀会耸动。多年来,科学家们一直依赖一种被称为“掩码建模”(masked modeling)的学习技术来教授计算机这项技能。想象一名学生试图通过阅读一段部分单词被遮盖的文本来学习语言;学生必须根据周围句子的语境来猜测缺失的单词。在数字领域,计算机被展示一段人的运动视频,但其中的某些部分被隐藏了。随后,机器必须预测这些隐藏部分原本的样子,通过尝试填补空白来学习人类运动的规律。

然而,一个显著的问题一直困扰着这种方法:计算机并不知道哪些部分的运动是重要的,应该被隐藏。目前的方法通常随机隐藏帧,或者隐藏那些最难预测的部分,并假设“难度”等于“重要性”。这是一个有缺陷的策略。在人类言语中,最有意义的手势往往发生在与词汇节奏和含义相契合的特定时刻,而不一定是那些在数学上难以重建的时刻。如果计算机隐藏了错误的帧,它学到的就是错误的教训,导致数字角色动作僵硬或在错误的时间做出手势。研究人员面临的核心问题是,他们是否可以利用语音本身作为引导,来识别究竟哪些运动时刻最为关键。

一组研究人员通过一个名为 EchoMask 的新框架解决了这一挑战。EchoMask 不再去猜测该隐藏哪些帧,而是利用语音音频提出了一个直接的问题:“这段运动的哪些部分与正在说的话联系最为紧密?”为了实现这一点,研究人员首先在声音与动作之间搭建了一座桥梁。他们创建了一个系统,可以将原始音频和原始运动数据投影到一个共享的心理空间中,从而使它们可以直接进行比较。在这个空间里,计算机学习将单词的声音与伴随该词的具体手势对齐,从而创建一个统一的表征,使声音和身体被理解为一个协调一致的整体事件。

一旦建立了这种对齐,系统就会使用一种类似于“聚光灯”的机制。它分析语音与运动之间的联系,为视频中的每一帧分配一个重要性得分。承载强语义信息的帧——例如强调关键词的手势——会获得高分。系统随后利用这些得分来决定在训练期间隐藏哪些内容。它不再是随机隐藏部分,而是有选择性地隐藏最具意义的帧,迫使计算机根据语音来学习如何重建最重要的手势。这个过程会随着时间的推移而不断优化;系统最初会较为宽松地隐藏帧,随后逐渐变得更加精准,以确保它学会专注于表达的关键时刻。

这种方法的成果令人瞩目。在与现有方法进行对比测试时,新系统生成的动作在真实感和与音频的同步性方面都显著提高。在视觉对比中,以往的模型经常生成尴尬或僵硬的手势,例如双手无力下垂,或动作方向与说话者的意图相悖。相比之下,新系统生成的动作流畅且富有表现力,能够匹配说话的情绪基调。例如,当说话者说出“never”(从不)这个词时,系统正确地将双手置于躯干附近,呈现出一种沉稳且有意的姿态,反映出深思熟虑的语气。当说出“drum”(鼓)这个词时,系统通过手臂的动态弧线捕捉到了该词的节奏感,而其他模型则忽略了这个细节。此外,该系统在面部表情方面也表现出色,能够捕捉到与特定发音相对应的唇部和下颚的精确运动,避免了其他方法中常见的僵硬或时机不当的表情。

除了视觉效果更好之外,该系统还展示了对声音与动作之间关系的更深层理解。通过对系统内部注意力图(attention maps)的分析显示,它成功识别并聚焦于语音与手势对齐的准确时刻,例如单词中的长元音或对特定名词的强调。通过在训练期间隐藏这些特定的、高价值的帧,模型被迫去学习人类交流的底层逻辑,而非仅仅是记忆模式。研究人员通过广泛的测试证实了这些发现,表明其方法在真实感、多样性和时机把握方面均优于现有的最佳技术。这项工作表明,通过让语音本身引导学习过程,计算机终于可以学会像它们所模仿的人类那样,拥有自然且富有表现力的流畅度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →