✨ 要点🔬 技术摘要
想象一下,你有一个机器人,它在两件事上都极其擅长,但它无法同时做这两件事。
机器人 A(观察者): 它可以观看一段人跳舞的视频,并精准地描述他们在做什么。但如果你要求它创造 一段新的舞蹈,它就会僵住。它就像一个能写出完美影评但却不会演戏的影评人。
机器人 B(创造者): 它可以根据一段文字描述(如“一个人在跳跃”)生成一段完美的 3D 动画。但如果给它看一段真实的人类视频,它却无法理解自己看到了什么。它就像一个能写剧本但却看不懂电影的导演。
多年来,计算机视觉领域一直受困于这两个独立的机器人。这篇新论文介绍了一个名为 “Superman” 的统一系统,它能同时扮演“观察者”和“创造者”的角色。
以下是它的工作原理,通过简单的概念进行拆解:
1. 问题所在:一种破碎的语言
目前,计算机使用两种不同的语言来表达动作:
视觉语言: 摄像头看到了什么(像素、颜色、形状)。
骨骼语言: 关节(臀部、肘部、膝盖)的数学坐标。
现有的模型通常只能掌握其中一种语言。如果一个模型从视频中学习,它就会忘记骨骼的数学规律;如果它从骨骼数学中学习,它就会忘记视觉上的现实。这造成了一种“脱节”。
2. 解决方案:一本“双语词典”(视觉引导的运动分词器)
为了解决这个问题,作者构建了一个特殊的翻译器,称为视觉引导的运动分词器(Vision-Guided Motion Tokenizer) 。
你可以把它想象成一本双语词典 ,其中的每个单词都有两个定义:
定义 A: 动作在视频中看起来 是什么样的(视觉外观)。
定义 B: 动作在数学上本质 是什么(3D 骨骼形状)。
模型不再仅仅基于数字学习一组“姿态”,而是学习一组“运动标记(motion tokens)”,这些标记既植根于视频画面,又植根于骨骼几何结构。这创造了一个“通用运动词汇表”,它既理解一次“跳跃”在视觉上呈现的样子,也理解其在数学上的意义。
3. 大脑:统领全局的模型
构建好这本词典后,他们将其接入了一个庞大的 AI 大脑(多模态大语言模型,或 MLLM)。因为大脑使用这种全新的“双语”语言,它可以利用完全相同的引擎处理三种截然不同的任务:
任务 1:侦探(姿态估计)
输入: 一段人物视频。
动作: 模型观看视频,并将其转化为一系列骨骼标记。
结果: 它输出精确的 3D 骨骼运动序列,逐帧呈现。
任务 2:预言家(运动预测)
输入: 骨骼运动的前几秒片段。
动作: 模型观察模式并预测序列中的下一个标记。
结果: 它在动作发生之前就生成了未来的运动。
任务 3:桥梁搭建者(运动插值/补全)
输入: 一个起始姿态和一个结束姿态(例如,“站立”和“坐下”)。
动作: 模型填充中间缺失的步骤。
结果: 它生成了人坐下的平滑动画过程。
4. 为什么它更好(结果)
论文将 Superman 与最优秀的“观察者”模型和最优秀的“创造者”模型进行了对比测试。
它击败了专家: 尽管它是一个承担三项工作的单一模型,但其表现优于那些专门为单一任务设计的模型。
它是一个出色的推测者: 当他们在一种数据集(Human3.6M)上进行训练并在完全不同的、未见过的数据集(3DPW)上进行测试时,它展现出了极强的泛化能力。它不仅仅是在死记硬背训练数据,而是真正学习了人类运动的“规则”。
它非常高效: 他们添加了一个微小的“辅助模块”(称为 MAFT),帮助大脑更好地连接视频和骨骼数据,但这仅增加了极小比例的计算开销。
核心结论
Superman 是第一个统一了人类运动“感知”与“生成”的系统。通过创建一个将动作“看起来的样子”与“本质属性”相联系的词典,它使得单个 AI 能够观看视频、预测未来并填补空白,且具备顶尖的准确度。它将碎片化的运动分析世界转化为了一个统一的、连贯的语言。
技术摘要:Superman:统一人类运动感知与生成的骨骼与视觉框架
1. 问题陈述
目前的人类运动分析领域呈现出严重的碎片化特征。现有的范式被分为两个截然不同、互不重叠的阵营:
感知模型(Perception Models): 这些模型(如 MotionBERT、SiC)擅长从原始视频中理解运动,但通常局限于输出文本描述或静态的 2D/3D 姿态,缺乏生成新的、合理的运动序列的能力。
生成模型(Generation Models): 这些模型(如 MotionGPT、MotionGPT3)能够根据文本或抽象输入生成运动序列,但往往缺乏感知或处理原始视觉输入(视频)的能力。此外,许多生成式多模态大语言模型(MLLMs)受限于单帧静态姿态以及稠密参数化模型(如 SMPL),无法捕捉时间动态特性。
此外,现有的运动词表仅基于骨骼数据构建,切断了与视觉领域的联系。这种“只读”与“只写”的二分法迫使研究人员为本质上相互关联的任务使用不同的架构,阻碍了模型利用感知与生成之间的协同关系。
2. 方法论
作者提出了 Superman ,一个统一的、多任务且多模态的生成式框架,将人类运动分析重新定义为一个条件序列生成问题。该框架由两个主要阶段组成:
A. 视觉引导的运动分词器 (VGMT)
该方法的核心是一个创新的分词器,它创建了一个离散的、跨模态的运动词表。与以往依赖纯骨骼工作的做法不同,VGMT 基于矢量量化变分自编码器(VQ-VAE)架构构建,旨在融合视觉外观与 3D 骨骼几何结构。
双流编码(Dual-Stream Encoding):
视觉流(Visual Stream): 使用视觉骨干网络(如 HRNet)从视频帧中提取以姿态为中心的视觉特征,并结合 视觉-骨骼注意力机制(VSA) 模块。VSA 通过基于投影 2D 关节位置预测采样偏移和权重,自适应地聚合特征,从而增强对遮挡的鲁棒性。
骨骼流(Skeletal Stream): 通过在关节-时间网格上使用轻量级 2D 卷积处理 3D 姿态序列,捕捉内在的运动几何结构。
混合码本量化(Hybrid Codebook Quantization): 系统采用混合码本,其中每个 Token 是一个由配对的视觉与几何原型组成的双模态实体。对于每个时间窗口,通过最小化融合后的视觉与骨骼特征与码本原型之间的联合欧氏距离来选择 Token 索引。这确保了离散化过程同时受到外观和几何结构的引导。
训练: 分词器通过结合重建损失和模态维度承诺损失(commitment losses)的 VQ 目标进行端到端训练。
B. 基于 MLLM 的统一多任务建模
一个单一的仅解码器(decoder-only)多模态大语言模型(具体为 Qwen2.5-VL-7B )作为核心序列处理器。
运动感知微调(MAFT): 一个可选的轻量级模块,将骨骼几何注入 MLLM 的视觉流中。它通过 VSA 模块增强视觉 Transformer(ViT)特征,通过交叉注意力机制将网格 Token(查询)与姿态 Token(键/值)进行融合。
任务统一(Task Unification): MLLM 使用标准的自回归交叉熵损失,在混合的任务特定格式上进行联合训练。它通过改变条件输入来处理三个不同的任务:
3D 姿态估计 (PE): 将视频片段转化为姿态 Token 序列。
运动预测 (MP): 在给定历史序列的情况下,自回归地预测未来的姿态 Token。
运动插值 (MIB): 在起始和结束关键帧之间生成中间 Token。
3. 核心贡献
统一框架: 提出了一个单一的生成式框架,利用单个 MLLM 实现多任务、多模态的人类运动分析,有效地弥合了运动感知与生成之间的鸿沟。
视觉引导的运动分词器: 引入了一种新型分词器,创建了鲁棒的跨模态姿态词表。通过设计一种将 Token 作为双模态实体(配对的视觉与几何原型)的混合码本,量化过程同时受视频外观和 3D 骨骼几何的引导。
达到最先进性能(SOTA): 证明了这种统一方法在多种任务(PE, MP, MIB)中均能达到最先进或具有竞争力的性能,验证了学习丰富的联合表示的有效性。
4. 实验结果
该框架在标准基准测试上进行了评估,主要包括 Human3.6M 和未见过的 3DPW 数据集。
在 Human3.6M 上的表现: Superman 在所有三个任务中均取得了最先进的结果。
姿态估计: 在 N-MPJPE 指标上,它超越了传统的多任务模型(如 Human-in-Context)11.97%,并超越了基于 LLM/MLLM 的方法(如 PoseLLaVA)10.91%。
运动预测与插值: 与传统及基于 LLM 的基线模型相比,它获得了最低的平均关节位置误差(MPJPE)。
泛化能力: 仅在 Human3.6M 上训练的 Superman 在 3DPW 数据集上展示了卓越的零样本泛化能力,在运动预测和插值任务中显著优于所有基线模型。
效率: 虽然大规模的 Qwen2.5-VL-7B 主导了资源消耗,但新引入的组件(MAFT 和 VSA)占总计算成本不足 0.03%,展示了极高的可扩展性。
消融实验:
分词器: 视觉与几何的联合学习至关重要;仅视觉的模型失败了,而仅骨骼的基线模型被融合配置显著超越。
训练策略: 统一的多任务训练策略始终优于针对单一任务训练的专门化模型,表明存在正向知识迁移。
规模效应: 增加模型规模(从 3B 到 7B)和码本容量一致降低了误差率,证实了该框架的可扩展性。
5. 意义
论文声称,Superman 代表了生成式运动分析的一种更高效、更具扩展性的路径。通过将运动概念化为一种通用语言,并将其植根于视觉和几何两种模态之中,这项工作挑战了当前人类运动分析领域碎片化的生态系统。它证明了单一的统一模型可以流畅地处理多模态输入——从用于姿态估计的完整视频到用于预测的骨骼序列——并生成连贯、结构化的 3D 运动,从而在统一的架构内实现了运动“阅读”与“书写”的统一。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。