Mitigating Error Accumulation in Co-Speech Motion Generation via Global Rotation Diffusion and Multi-Level Constraints
本文介绍了 GlobalDiff,一种新颖的基于扩散的框架,它通过直接在全局关节旋转空间中进行操作,并采用多级约束方案来确保结构完整性和时间一致性,从而缓解长时程协同语音手势生成中的误差累积问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个虚拟角色正在与你交谈。为了让对话显得真实,角色不能仅仅是动动嘴巴;整个身体都必须参与其中。肩膀会移动,双手会做手势,姿态也会随着声音的节奏和情感而变化。这就是协同语音动作生成(co-speech motion generation)的目标:教会计算机创造出能与说话内容自然同步的全身动作。多年来,研究人员一直试图通过构建数字骨架来解决这个问题,即通过累加肩部、肘部和腕部的旋转来计算手的运动。虽然这种方法模仿了骨骼是如何连接的,但它隐藏着一个缺陷。就像一长排人传递信息时,一个小小的错误可能会导致最终的信息完全错误一样,计算肩部旋转时的微小误差会随着向手臂末端传递而不断放大。当计算机计算到指尖的位置时,误差可能已经变得如此巨大,以至于手看起来是扭曲的、破碎的,或者以一种不可能的方式漂浮着。
阿里巴巴集团和南洋理工大学的研究团队提出了一种解决此问题的新方法,完全摒弃了这种“连锁反应”式的方法。与其计算每个关节相对于前一个关节如何转动,不如使用名为 GlobalDiff 的新系统,同时决定房间内每一个关节的最终指向方向。你可以把它想象成直接告诉每个关节在世界中应该指向哪里,而不是告诉肘部相对于肩膀应该指向哪里。这种方法阻止了误差的堆积,确保即使在漫长且富有表现力的对话过程中,手部和足部也能保持稳定和准确。然而,给予每个关节完全的自由会带来一个新的风险:角色可能会将肢体扭曲成人类身体物理上无法实现的形状。为了解决这个问题,研究人员加入了一套隐形的规则作为引导,检查骨骼是否保持正确的长度、肢体间的角度是否合理,以及动作是否随时间平滑流动。
研究人员在包含 1,7 m 多个对话序列的大型记录集上对这个新系统进行了测试。他们发现,通过直接预测关节的全局方向,计算机生成的动作比以往的方法要稳定得多。在测试中,新系统比现有的最佳工具减少了 46% 的最终运动误差。当他们仔细观察结果时,差异显而易见。在旧系统中,手指经常看起来像是翻转到了内部,或者手部会偏离身体。而在新方法下,手部保持在自然的位置,且手势与说话者的声音匹配,精准度极具人性化。该系统还学会了处理不同的说话者,无论声音属于男性还是女性,是母语人士还是带有不同口音的人,都能保持这种高质量。
为了确保动作不仅稳定而且符合物理规律,团队引入了三层检查机制。首先,他们在每个关节周围放置了虚拟标记,以确保旋转的精确性,防止肢体发生不自然的扭曲。其次,他们测量了全身所有骨骼之间的角度,以确保骨架保持完整,防止角色弯曲脊椎或肢体到不可能的方向。第三,他们分析了动作的时机,以确保手势随说话的节奏流畅进行,避免出现僵硬或不规则的动作。当他们逐一移除这些检查时,动作的质量显著下降,这证明了要创造出令人信服的结果,这三层检查都是必要的。
这项研究表明,可以为虚拟角色生成逼真的、长时间的肢体语言,而不会出现长期困扰该领域的误差累积问题。通过将整个身体视为受严格物理规则引导的一组独立部分,研究人员创造了一个能够产生平滑、符合解剖学结构且富有表现力的动作系统。这项工作表明,虚拟化身的未来可能不再依赖于容易出错的复杂链式计算,而是依赖于对身体各部分如何在空间中运动的直接、全局性的理解。其结果是一个能够以自然感进行言语和动作互动的数字存在,使我们与机器之间的交互变得更加无缝。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。