← 最新论文
🤖 AI

Coordinating Multiple Conditions for Trajectory-Controlled Human Motion Generation

本文提出了CMC,这是一种解耦的两阶段框架,通过首先利用简化表示确保精确的轨迹跟随,随后借助增强有选择性修复机制的文本条件修复模型完成全身动作生成,从而协调文本与轨迹条件以生成人体动作,并实现最先进的性能。

原作者: Deli Cai, Haoyang Ma, Changxing Ding

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Deli Cai, Haoyang Ma, Changxing Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在执导一个电影场景,其中一名演员必须沿着地板上画出的非常特定的路径(例如一个三角形)行走,同时完成特定的动作(例如“跳舞”)。

问题:“双头”导演
以往的方法试图通过让两名导演同时向演员喊话来实现这一目标。一名导演大喊“跳舞!”(文本指令),另一名导演大喊“保持在路径上!”(轨迹指令)。由于这些指令截然不同——一个是模糊的感觉,另一个是精确的几何线条——演员会感到困惑。他们可能会开始跳舞但偏离路径,或者可能完美地保持在路径上却完全停止跳舞。

此外,这些旧方法试图同时控制演员身体的每一个细节(速度、旋转、脚部位置等)。这就像在驾驶时试图同时调整车轮、发动机和方向盘来操控汽车;它导致动作变得摇摆不定且不稳定。

解决方案:CMC(“分而治之”策略)
作者提出了一种名为CMC(协调多条件)的新系统。他们不再使用一名困惑的导演,而是采用一个将任务分离的两步流水线。

第一步:“骨架”架构师(轨迹控制)
首先,系统忽略舞蹈的华丽细节。它只关注动作的“骨架”:臀部以及你希望控制的具体关节(如手或脚)。

  • 类比:想象一位建筑师正在绘制一个人沿着走钢丝行走的简单线框图。他们暂时不关心这个人的衬衫颜色或面部表情;他们只确保线框图完美地保持在走钢丝上。
  • 技巧:他们使用身体数据的“简化”版本。与其追踪速度和旋转,他们只追踪关节的位置。这使得路径跟随变得极其稳定和准确。

第二步:“服装设计师”(动作补全)
一旦线框图被锁定在走钢丝上的正确位置,系统便进入第二阶段。现在,它引入“文本”指令(例如“跳舞”)。

  • 类比:服装设计师在固定的线框图基础上填充身体的其余部分。他们根据文本描述添加手臂、腿部以及动作风格。
  • 安全网:由于线框图已经固定在正确位置,服装设计师无需担心人物偏离走钢丝。他们可以完全专注于让舞蹈看起来自然且富有表现力。

秘诀:“选择性修复”
存在一种风险,即“服装设计师”(第二步)可能过于擅长仅仅复制线框图,而忘记了如何独立跳舞。为了解决这个问题,作者引入了一种名为SIM(选择性修复机制)的训练技术。

  • 类比:想象教导一名学生绘制肖像。如果你只让他们在预先画好的草图上进行涂绘,他们可能会忘记如何从头开始画一张脸。因此,老师随机告诉他们:“今天,在草图上进行涂绘(修复)。”“明天,在没有草图的情况下从头画一张整脸(文本到动作)。”
  • 结果:这保持了模型的灵活性。它学会了在给定路径时填补空白,同时也记住了如何从头开始创造自然动作,防止其变得僵化或“过拟合”。

结果
通过将“路径”与“风格”分离,CMC 解决了冲突。其结果是生成的人类动作既能完美遵循路径(像走钢丝者一样),又看起来像自然、富有表现力的舞蹈(像表演者一样)。

该论文表明,这种方法在标准数据集上优于以往的“双头导演”方法,生成的动作既准确贴合路径,又在外观上逼真自然。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →