✨ 要点🔬 技术摘要
想象一个数字人在向你说话,它的双唇随着言语完美同步地移动,双手自然地做着手势以强调重点。多年来,科学家们一直教导计算机通过聆听音频来创造这些动作,从而使角色能够说话并展现出令人惊讶的逼真动作。然而,一个显著的局限性一直存在:虽然计算机知道如何让角色挥手或耸肩,但它无法被明确告知手部应该落在空间的哪个位置。如果动画师想要角色的右手腕触碰桌上的某个特定物体,或者让肘部沿着一条精确的路径移动以避开障碍物,现有的技术无法做到这一点。动作是作为一个整体生成的,导致身体部位的具体位置取决于随机性而非指令。这种自然语音驱动运动与精确空间控制之间的差距,一直是创建真正具有交互能力的虚拟智能体的主要障碍。
由 Meta 和北卡罗来纳大学夏洛特分校的研究人员提出的一种新方法,通过一种名为 InteractGesture 的方法弥补了这一差距。该系统允许计算机根据语音生成角色的手势,同时服从关于特定关节(如手腕或肘部)必须到达何处的严格指令。研究人员将计算机的运动生成器视为一个可以被轻轻引导的“黑盒”。他们并没有重新训练整个系统或改变其内部大脑,而是实时调整计算机的预测。当系统规划一段动作时,研究人员将这些计划解码为一个 3D 骨架,检查手部是否在正确的位置;如果不在,他们会在最终确定之前,将计划向目标位置进行推挤。这个过程发生得极快,以至于计算机能够学会平衡语音的自然节奏与用户严苛的空间指令。
当语音是连续的(例如长对话)而非短片段时,挑战会变得显著困难。计算机通常将长音频处理成小的、重叠的段落或“块”。在过去,一旦一个段落被生成,它就会被固定下来。如果用户希望角色的手在下一个段落中触及一个目标,计算机无法回头去调整前一个段落的动作,以确保过渡平滑。这经常导致僵硬、不自然的跳跃,即手部会突然猛地弹跳到位置上。研究人员发现,这种对过去运动的僵化锁定是导致这些错误的主要原因。为了解决这个问题,他们开发了一种称为“渐进式块引导”(Progressive Chunk Guidance)的策略。该方法不再冻结过去,而是保留一个较小的近期运动可编辑窗口。随着新音频的到来,系统会不断更新前一个段落的上下文,允许未来的指令轻轻地引导过去的运动,使其实现更平滑的对齐。这有点像在拍摄电影的同时进行剪辑,导演可以调整演员的上一步动作,以确保下一步能够完美落地,而无需等待整部电影拍摄完成。
该方法的成果在一套包含人类语音和运动记录的大型数据集上进行了测试。团队将他们的新方法与旧技术进行了对比,其中包括一种试图在动作生成后强行将关节置于原位的常用方法,以及另一种试图独立控制每个段落的方法。旧方法往往产生看起来僵硬或不自然的动作,或者无法准确达到目标位置,在某些情况下误差接近二十厘米。相比之下,新方法实现的平均误差仅为六厘米多一点,同时保持了原始语音驱动手势的流畅与自然。该系统成功地引导角色的手指向特定点,让手臂追踪复杂路径,甚至让角色转向特定方向,同时保持动作的时机与声音完美同步。
这项工作证明,既可以拥有语音驱动动画的自然流向,也可以拥有人类动画师的精确控制。通过允许计算机在生成过程中不断完善其计划,并通过保持近期过去的灵活性以适应未来的指令,研究人员创造了一个既尊重用户空间指令,又不牺牲运动生动品质的系统。研究结果表明,数字人类很快就能像真实的演员一样受到精细指导,能够与虚拟物体互动,并在复杂的环境中以以往难以企及的精度进行导航。研究人员已将其工具开放给他人使用,为未来更具交互性和响应能力的虚拟助手及角色开启了大门。
技术摘要:InteractGesture
问题陈述
协同语音手势生成(Co-speech gesture generation)在生成与说话人音频同步的逼真全身动作方面已取得了显著进展。然而,现有模型主要侧重于无约束生成,缺乏对单个身体关节的细粒度空间可控性 。实际应用(如数字人、虚拟智能体和具身助手)需要精确的空间编辑(例如,引导手腕指向特定物体、用双手框住一个物品或指向一个界面),同时保持自然的语音-手势同步性。
一个关键的技术挑战出现在连续流式生成 中。标准的推理过程会对有限且重叠的块(chunks)进行音频处理。在严格的顺序处理方法中,一旦一个块被生成,它就会被冻结。这产生了一个依赖瓶颈:如果未来块(k + 1 k+1 k + 1 )中的空间约束要求对前序块(k k k )中的轨迹进行调整,由于块 k k k 的状态已被冻结,这种修正无法实现,从而导致运动不连续以及跨块边界的控制不一致。
方法论
作者提出了 InteractGesture ,一种与模型无关的推理时空间可控手势生成框架。该方法并不重新训练底层的生成器,而是通过引导预训练扩散模型的采样过程来实现。
核心机制:潜空间引导(Latent Guidance)
InteractGesture 将预训练的手势生成器视为一个去噪过程。在选定的采样步骤中,预测的干净目标潜变量估计值(x ^ 0 \hat{x}_0 x ^ 0 )通过一个可微的 RVQ-VAE 解码器 解码为人体姿态(SMPL-X 关节)。
损失计算: 在解码后的关节位置与用户指定的控制目标(位置、轨迹或方向)之间计算掩码空间损失(masked spatial loss)。
梯度反向传播: 梯度从空间损失通过可微解码器反向传播,以更新目标潜变量估计值 x ^ 0 \hat{x}_0 x ^ 0 ,而非更新模型参数。
去噪更新: 调整后的潜变量估计值用于更新当前的运动潜变量 x i − 1 x_{i-1} x i − 1 。随后的采样步骤允许学习到的评分网络(score network)将运动重新正则化回语音调节的手势分布,从而平衡空间约束与自然度。
渐进式块引导(Progressive Chunk Guidance)
为了解决流式生成中的依赖问题,作者引入了渐进式块引导 。不同于标准顺序推理(冻结过去的块)或完全同步推理(需要获取整个序列的离线访问),该策略维护了一个可编辑块潜变量的活跃窗口 。
交错延迟: 新的块相对于当前采样步骤以交错延迟的方式引入。
双向传播: 随着新块的到来,前序块仍保持在活跃的可编辑状态。来自未来块的空间约束可以跨越块边界向后传播梯度,以调整前序轨迹。
上下文刷新: 新块的上下文帧通过前序块最新的引导估计值进行持续刷新,从而在遵循固定流式延迟预算的同时,确保运动的平滑连续性。
控制表示
系统通过目标位置张量(H H H )和二进制掩码(M M M )支持多种控制模式:
稀疏关节位置控制: 指导特定关节在指定帧指向物体。
密集关节轨迹控制: 引导关节沿连续路径运动。
指向方向控制: 将肢体朝向目标方向。
核心贡献
InteractGesture 框架: 一种与模型无关的推理时方法,能够在不修改生成器架构或训练目标的情况下,为预训练的协同语音手势生成器提供细粒度的空间控制。
渐进式块引导: 一种新颖的块窗口采样策略,解决了流式生成与全局空间一致性之间的冲突,允许未来的约束影响前序运动,而无需进行全序列的离线处理。
全面评估: 在 BEAT2 数据集 上进行了广泛评估,证明了该方法在支持稀疏定位、密集轨迹追踪和定向指向的同时,能够保持手势质量。
实验结果
该方法在 BEAT2 数据集上使用 GestureLSM 作为基础生成器进行了评估。主要发现包括:
空间准确度: 采用渐进式块引导的 InteractGesture 实现了 6.34 cm 的平均控制误差 以及 16.1% 的位置误差 (误差 > 10cm)。这显著优于:
逆运动学(IK): 由于缺乏生成正则化,其误差较高(19.97 cm)且姿态不自然(FGD 1.043)。
块级 ControlNet: 由于对相邻上下文的访问受限,误差较高(46.16 cm)。
顺序块引导: 由于过去的块被冻结导致无法进行后向调整,误差中等(11.70 cm)。
手势质量: 该方法保留了语音调节的自然度,实现了 **0.431 的 Fréchet 手势距离(FGD)**和 0.762 的节拍一致性(BC) ,与地面真值(Ground Truth)相当,且优于后验几何拟合方法。
消融研究:
全量引导: 结合采样引导(去噪期间)和后验精细化(post-refinement)效果最佳。采样引导提供了粗略对齐,而后验精细化则对最终的潜变量估计进行了微调。
尺度敏感性: 在流式设置中,0.5 的引导尺度在空间精度与手势自然度之间达到了最佳平衡。
流式 vs. 离线: 虽然离线同步块引导 实现了最高的精度(4.67 cm 误差),但渐进式块引导 在保持相当准确度(6.34 cm 误差)的同时,实现了连续的流式执行。
重要意义
论文声称 InteractGesture 弥补了高质量、语音同步手势生成与实际精确空间交互需求之间的鸿沟。通过在连续流式生成过程中实现细粒度的多关节 3D 空间控制 ,该方法支持了以往非约束生成模型无法实现的复杂具身交互(如指向、物体操作)。渐进式块引导 机制被强调为一项关键创新,它调和了长程可控性与在线流式推理约束之间的矛盾。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。