← 最新论文
💻 computer science

InteractGesture: Progressive Chunk Guidance for Continuous Streaming Co-Speech Gesture Control

该论文介绍了 InteractGesture,这是一种与模型无关的推理时方法,它采用渐进式分块引导(Progressive Chunk Guidance)技术,通过在分块边界间传播控制梯度以解决边界不一致问题,从而在连续流式场景中实现细粒度、空间可控的共语手势生成。

原作者: Ekkasit Pinyoanuntapong, Ajinkya Deogade, Paul Streli, Wenjing Zhang, Joanna Materzynska, Pu Wang, Vittorio Ferrari, Jie Shen

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Ekkasit Pinyoanuntapong, Ajinkya Deogade, Paul Streli, Wenjing Zhang, Joanna Materzynska, Pu Wang, Vittorio Ferrari, Jie Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个数字人在向你说话,它的双唇随着言语完美同步地移动,双手自然地做着手势以强调重点。多年来,科学家们一直教导计算机通过聆听音频来创造这些动作,从而使角色能够说话并展现出令人惊讶的逼真动作。然而,一个显著的局限性一直存在:虽然计算机知道如何让角色挥手或耸肩,但它无法被明确告知手部应该落在空间的哪个位置。如果动画师想要角色的右手腕触碰桌上的某个特定物体,或者让肘部沿着一条精确的路径移动以避开障碍物,现有的技术无法做到这一点。动作是作为一个整体生成的,导致身体部位的具体位置取决于随机性而非指令。这种自然语音驱动运动与精确空间控制之间的差距,一直是创建真正具有交互能力的虚拟智能体的主要障碍。

由 Meta 和北卡罗来纳大学夏洛特分校的研究人员提出的一种新方法,通过一种名为 InteractGesture 的方法弥补了这一差距。该系统允许计算机根据语音生成角色的手势,同时服从关于特定关节(如手腕或肘部)必须到达何处的严格指令。研究人员将计算机的运动生成器视为一个可以被轻轻引导的“黑盒”。他们并没有重新训练整个系统或改变其内部大脑,而是实时调整计算机的预测。当系统规划一段动作时,研究人员将这些计划解码为一个 3D 骨架,检查手部是否在正确的位置;如果不在,他们会在最终确定之前,将计划向目标位置进行推挤。这个过程发生得极快,以至于计算机能够学会平衡语音的自然节奏与用户严苛的空间指令。

当语音是连续的(例如长对话)而非短片段时,挑战会变得显著困难。计算机通常将长音频处理成小的、重叠的段落或“块”。在过去,一旦一个段落被生成,它就会被固定下来。如果用户希望角色的手在下一个段落中触及一个目标,计算机无法回头去调整前一个段落的动作,以确保过渡平滑。这经常导致僵硬、不自然的跳跃,即手部会突然猛地弹跳到位置上。研究人员发现,这种对过去运动的僵化锁定是导致这些错误的主要原因。为了解决这个问题,他们开发了一种称为“渐进式块引导”(Progressive Chunk Guidance)的策略。该方法不再冻结过去,而是保留一个较小的近期运动可编辑窗口。随着新音频的到来,系统会不断更新前一个段落的上下文,允许未来的指令轻轻地引导过去的运动,使其实现更平滑的对齐。这有点像在拍摄电影的同时进行剪辑,导演可以调整演员的上一步动作,以确保下一步能够完美落地,而无需等待整部电影拍摄完成。

该方法的成果在一套包含人类语音和运动记录的大型数据集上进行了测试。团队将他们的新方法与旧技术进行了对比,其中包括一种试图在动作生成后强行将关节置于原位的常用方法,以及另一种试图独立控制每个段落的方法。旧方法往往产生看起来僵硬或不自然的动作,或者无法准确达到目标位置,在某些情况下误差接近二十厘米。相比之下,新方法实现的平均误差仅为六厘米多一点,同时保持了原始语音驱动手势的流畅与自然。该系统成功地引导角色的手指向特定点,让手臂追踪复杂路径,甚至让角色转向特定方向,同时保持动作的时机与声音完美同步。

这项工作证明,既可以拥有语音驱动动画的自然流向,也可以拥有人类动画师的精确控制。通过允许计算机在生成过程中不断完善其计划,并通过保持近期过去的灵活性以适应未来的指令,研究人员创造了一个既尊重用户空间指令,又不牺牲运动生动品质的系统。研究结果表明,数字人类很快就能像真实的演员一样受到精细指导,能够与虚拟物体互动,并在复杂的环境中以以往难以企及的精度进行导航。研究人员已将其工具开放给他人使用,为未来更具交互性和响应能力的虚拟助手及角色开启了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →