← 最新论文
💬 NLP

SeMoCo: A Semantic-First Motion Codec for Motion Language Modeling

该论文介绍了 SeMoCo,一种语义优先的运动编解码器,它将运动标记分解为语义和运动学组件,以提高重建精度和语言驱动的运动生成能力,并同时创建了大规模的 Ω\Omega-MotionVerse 数据集。

原作者: Tianlv Huang, Hetian Guo, Ziyi Cai, Song Wang, Yanping Zhang, Zipei Fan, Xuan Song, Guangming Wu, Xin Zheng

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianlv Huang, Hetian Guo, Ziyi Cai, Song Wang, Yanping Zhang, Zipei Fan, Xuan Song, Guangming Wu, Xin Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

让计算机理解人类运动是一个处于语言与物理学交汇点的难题。多年来,研究人员一直试图教会机器根据文本描述生成逼真的动作,要求它们根据一个简单的句子创建一个人走路或跳跃的视频。为了实现这一点,计算机需要一种将人体在空间中连续、流动的运动转化为其可以处理的格式的方法,就像将一段口语句子转化为一串字母一样。早期的尝试将运动视为平滑、不间断的数据流,但最近的一种方法表明,将运动分解为离散的、独立的单元——就像句子中的单词一样——可以让计算机生成更复杂且更多变的动作。然而,一个显著的障碍仍然存在:用于将运动分解为这些单元的工具主要是为了尽可能准确地重建运动而设计的,而不是为了理解运动本身的含义。它们将细微的重心转移与深蹲这类重大动作视为同类数据,迫使计算机只能通过试错来学习其中的区别。

一组研究人员推出了一种名为 SeMoCo 的新系统,它改变了这种翻译发生的方式。该方法不再强迫计算机在尝试重建运动的同时去猜测运动的含义,而是从一开始就将这两个任务分离。该系统将运动的每一刻都视为一个包含两个不同部分的微小信息包:一个捕捉动作总体含义的主代码,以及一系列填充身体运动精细细节的次级代码。这种方法的设计灵感来自于语音识别的工作原理,即单词的核心含义与其说话者声音的具体细微差别是分离的。通过为动作的含义提供一个专门的“插槽”,该系统可以根据运动的“故事”来预测接下来的发展,同时由一个独立的过程来处理关节的精确几何结构。

研究人员利用他们创建的大规模人类运动数据集构建了这个系统,并将其命名为 Ω-MotionVerse。该数据集汇集了来自各种来源(包括专业动作捕捉和视频重建)的近一千小时记录的运动,并将它们标准化为单一且一致的格式。他们在这些数据上训练了新的编解码器 SeMoCo,以学习如何将运动压缩成这些双层数据包。结果显示,该系统重建人物运动的准确度高于以往的方法,将关节位置的误差降低到了几乎察觉不到的水平。更重要的是,当研究人员使用这些数据包根据文本描述生成新的运动时,计算机生成的动作不仅在物理上是逼真的,而且在语义上也是正确的,能够更可靠地匹配提示词的意图。

核心创新在于系统组织信息的方式。在旧的方法中,计算机必须同时搞清楚运动的含义和关节的细节,这往往会导致一种折中方案,即为了其中之一而牺牲另一方。SeMoCo 通过使用“语义优先”的方法避免了这个问题。当系统观察一段短时间的运动时,它首先识别出宏观动作(例如“坐下”或“转身”),并将此分配给一个特定的标记(token)。然后,它使用另一组标记来描述肢体的精确轨迹以及脚部与地面的接触。这种分离使得语言模型能够专注于动作序列的推进(即动作的故事线),而不会被每个关节角度的复杂数学计算所困扰。模型根据之前的动作来预测下一个动作,然后填充该动作的具体细节,从而创造出一个既高效又精确的生成过程。

为了测试他们的工作,研究人员使用标准的运动生成和预测基准,将他们的系统与几种现有模型进行了对比。在仅根据压缩形式重建记录运动的任务中,SeMoCo 表现优于所有其他方法,在测量预测关节与实际关节之间的距离方面达到了最低误差率。在被要求根据文本生成新运动时,该系统展示了强大的结果,特别是在其将文本描述与生成的运动相匹配的能力方面。研究人员发现,虽然较大的模型通常在生成基于文本的运动方面表现更好,但规模带来的优势并非普遍适用;对于根据一段简短的历史片段来预测未来运动的任务,他们模型中一个更小、更专门的版本实际上表现得更好。这表明,信息的组织方式与计算机内存的单纯大小同样重要。

这项研究还强调了这种新设计中固有的权衡。通过优先考虑运动的语义含义,该系统与那些完全忽略含义的系统相比,在重建的绝对精度上确实承受了一定的代价。然而,研究人员认为,对于任何需要计算机理解并根据语言生成动作的应用场景来说,这是一个必要且有益的交换。该系统并不声称已经完全解决了人类运动生成的问题,但它通过展示分离“做什么”与“怎么做”可以带来更好的结果,为未来指明了一条清晰的路径。这项工作证明,当计算机被赋予一种清晰、结构化的方式来理解运动背后的意图时,它所生成的动作不仅在物理上是合理的,而且能够真正响应用户的指令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →