← 最新论文
💻 computer science

Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation

该论文介绍了“Superman”,这是一个通过视觉引导运动分词器(Vision-Guided Motion Tokenizer)和单一多模态大语言模型(MLLM)架构,将视觉感知与基于骨骼的时间运动生成相连接的统一框架,在多种人类运动分析任务中实现了最先进的性能。

原作者: Xinshun Wang, Peiming Li, Ziyi Wang, Zhongbin Fang, Zhichao Deng, Songtao Wu, Jason Li, Mengyuan Liu

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinshun Wang, Peiming Li, Ziyi Wang, Zhongbin Fang, Zhichao Deng, Songtao Wu, Jason Li, Mengyuan Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个机器人,它在两件事上都极其擅长,但它无法同时做这两件事。

  • 机器人 A(观察者): 它可以观看一段人跳舞的视频,并精准地描述他们在做什么。但如果你要求它创造一段新的舞蹈,它就会僵住。它就像一个能写出完美影评但却不会演戏的影评人。
  • 机器人 B(创造者): 它可以根据一段文字描述(如“一个人在跳跃”)生成一段完美的 3D 动画。但如果给它看一段真实的人类视频,它却无法理解自己看到了什么。它就像一个能写剧本但却看不懂电影的导演。

多年来,计算机视觉领域一直受困于这两个独立的机器人。这篇新论文介绍了一个名为 “Superman” 的统一系统,它能同时扮演“观察者”和“创造者”的角色。

以下是它的工作原理,通过简单的概念进行拆解:

1. 问题所在:一种破碎的语言

目前,计算机使用两种不同的语言来表达动作:

  • 视觉语言: 摄像头看到了什么(像素、颜色、形状)。
  • 骨骼语言: 关节(臀部、肘部、膝盖)的数学坐标。

现有的模型通常只能掌握其中一种语言。如果一个模型从视频中学习,它就会忘记骨骼的数学规律;如果它从骨骼数学中学习,它就会忘记视觉上的现实。这造成了一种“脱节”。

2. 解决方案:一本“双语词典”(视觉引导的运动分词器)

为了解决这个问题,作者构建了一个特殊的翻译器,称为视觉引导的运动分词器(Vision-Guided Motion Tokenizer)

你可以把它想象成一本双语词典,其中的每个单词都有两个定义:

  • 定义 A: 动作在视频中看起来是什么样的(视觉外观)。
  • 定义 B: 动作在数学上本质是什么(3D 骨骼形状)。

模型不再仅仅基于数字学习一组“姿态”,而是学习一组“运动标记(motion tokens)”,这些标记既植根于视频画面,又植根于骨骼几何结构。这创造了一个“通用运动词汇表”,它既理解一次“跳跃”在视觉上呈现的样子,也理解其在数学上的意义。

3. 大脑:统领全局的模型

构建好这本词典后,他们将其接入了一个庞大的 AI 大脑(多模态大语言模型,或 MLLM)。因为大脑使用这种全新的“双语”语言,它可以利用完全相同的引擎处理三种截然不同的任务:

  • 任务 1:侦探(姿态估计)

    • 输入: 一段人物视频。
    • 动作: 模型观看视频,并将其转化为一系列骨骼标记。
    • 结果: 它输出精确的 3D 骨骼运动序列,逐帧呈现。
  • 任务 2:预言家(运动预测)

    • 输入: 骨骼运动的前几秒片段。
    • 动作: 模型观察模式并预测序列中的下一个标记。
    • 结果: 它在动作发生之前就生成了未来的运动。
  • 任务 3:桥梁搭建者(运动插值/补全)

    • 输入: 一个起始姿态和一个结束姿态(例如,“站立”和“坐下”)。
    • 动作: 模型填充中间缺失的步骤。
    • 结果: 它生成了人坐下的平滑动画过程。

4. 为什么它更好(结果)

论文将 Superman 与最优秀的“观察者”模型和最优秀的“创造者”模型进行了对比测试。

  • 它击败了专家: 尽管它是一个承担三项工作的单一模型,但其表现优于那些专门为单一任务设计的模型。
  • 它是一个出色的推测者: 当他们在一种数据集(Human3.6M)上进行训练并在完全不同的、未见过的数据集(3DPW)上进行测试时,它展现出了极强的泛化能力。它不仅仅是在死记硬背训练数据,而是真正学习了人类运动的“规则”。
  • 它非常高效: 他们添加了一个微小的“辅助模块”(称为 MAFT),帮助大脑更好地连接视频和骨骼数据,但这仅增加了极小比例的计算开销。

核心结论

Superman 是第一个统一了人类运动“感知”与“生成”的系统。通过创建一个将动作“看起来的样子”与“本质属性”相联系的词典,它使得单个 AI 能够观看视频、预测未来并填补空白,且具备顶尖的准确度。它将碎片化的运动分析世界转化为了一个统一的、连贯的语言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →