← 最新论文
💻 computer science

GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling

GestureLSM 是一个基于流匹配(flow-matching)的新颖框架,它通过建模身体区域之间的时空交互,并引入潜在捷径学习(latent shortcut learning)以显著加速推理速度,从而生成高质量、连贯的全身言语协同手势。

原作者: Pinxin Liu, Luchuan Song, Junhua Huang, Haiyang Liu, Junfan Zhu, Chenliang Xu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Pinxin Liu, Luchuan Song, Junhua Huang, Haiyang Liu, Junfan Zhu, Chenliang Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在交谈的静谧时刻,当言语显得不足以表达意图时,人体会诉说其自身的语言。一次耸肩、一次挥手或是一个姿态的转变,往往承载着与所说句子同等的分量。这些动作并非随机,它们是时间与协调编织而成的紧密锦缎,手、臂与躯干以统一的节奏运动,用以传达情感与意义。几十年来,科学家和工程师一直试图教会计算机模拟这种无声的对话,希望赋予数字虚拟形象如同真人般的自然流畅感。挑战始终是双重的:既要创造出看起来真正像人的动作,又要确保其速度足以实现实时响应。以往的尝试通常将身体视为一组独立的部件,在移动手臂时忽略了腿部,或在移动双手时未考虑面部,导致生成的姿态显得脱节且机械。此外,生成这些动作所需的复杂数学运算通常耗时过长,无法用于实时交互,从而在技术能力与人类需求之间留下了鸿沟。

现在,一组研究人员通过一个名为 GestureLSM 的新系统弥补了这一差距,该系统旨在根据语音和文本剧本生成高质量且具备实时速度的全身人类姿态。其创新的核心在于他们看待人体的方式。系统并非将身体视为一个单一的整体或一组孤立的肢体,而是明确地对不同区域之间的相互作用进行建模,例如手部与躯干之间的关系。通过教会计算机理解“姿态是身体各部位之间的对话”,该系统产生的动作变得连贯且自然。当一个人说“我完全同意”时,系统知道手指可能会指向某处,手臂可能会延伸,而躯干可能会轻微偏移,所有这些都在协同工作以强化信息。这种方法避免了早期方法中常见的尴尬且不协调的动作,在那些方法中,身体各部位似乎在独立运动。

为了实现这种协调水平,研究人员构建了一个关注两种不同关系的模型。首先,它在单一的时间点内全局观察身体,确保左手的位置相对于右手和头部是合理的。其次,它观察身体随时间变化的动态,追踪从一秒到下一秒的运动流。这种双重关注使系统既能学习姿态的结构平衡,又能学习姿态的动态演进。其结果是,数字表演能够捕捉到人类表达中的细微差别,从微妙的倾斜到大幅度的强调性挥动,并与所说的词句完美同步。

速度是该团队需要攻克的另一个主要障碍。许多现有系统依赖于需要进行数十次重复计算来精炼单个动作的方法,这一过程对于实际应用来说过于缓慢。新系统采用了不同的数学方法,直接对运动的速度和方向进行建模,从而能以更少的步骤达到最终结果。然而,研究人员发现,这种更快的方法虽然在理论上很有前景,但有时会产生较低质量的结果,或者仍然耗时过长。为了解决这个问题,他们引入了一种技术,允许模型在生成运动的过程中学习“捷径”。系统不再沿着漫长的路径采取每一个微小的步骤,而是学会更直接地预测运动的目标位置,同时仍保持旅程的平滑与准确。他们还调整了系统随时间学习的方式,使其注意力集中在最容易出错的时刻,从而进一步提升了输出质量。

这种新方法的有效性通过使用大规模人类姿态记录数据集,针对广泛的现有方法进行了测试。结果显示,该系统生成的姿态比以往任何方法都更加真实,并且与语音的同步性更好。在速度方面,该系统可以在不到一秒的时间内生成一整句姿态,相比其他技术所需的数秒甚至数分钟,这是一个巨大的飞跃。这种速度足以支持实时应用,例如交互式数字虚拟形象或能够即时响应用户的虚拟助手。研究人员还开展了一项针对人类参与者的研究,参与者一致认为,与其他领先技术相比,新系统的姿态更加自然、平滑且时机把握更精准。

这项工作的意义不仅在于让数字角色看起来更出色。通过使计算机能够生成高质量、实时的姿态,这项技术为虚拟环境中的沉浸式和互动式体验开启了大门。无论是对于娱乐、教育还是通信领域,拥有一个能够以人类般的自然优雅姿态运动的虚拟形象,都会改变我们体验数字空间的方式。研究人员通过使用他们的系统生成 3D 身体姿态,并将其投影到 2D 视频中,创建了可以针对特定故事或应用进行定制的动画角色,以此展示了这种潜力。这种将语音转化为实时流利、富有表现力的动作的能力,标志着人类与计算机交互领域的重大进步,让我们离这样一个未来更近一步:在那时,数字生命不仅能通过语言,还能通过身体的完整自然语言与我们交流。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →