想象一下,你想教一个数字角色(比如视频游戏中的化身)如何移动。传统上,你可能必须手动编写每一次肌肉抽动来完成行走、跳跃或跌倒。或者,你可以使用一个“老师”来向角色展示如何移动,但角色经常会感到困惑、忘记所学的内容,或者开始做出一些奇怪、不自然的动作。
这篇论文介绍了一种名为 GPC (Generative Pretrained Controllers,生成式预训练控制器) 的新系统。可以将 GPC 想象成一个“超级智能运动库”,它通过观察超过 600 小时 多样化的人类运动(从行走、跑步到翻滚和空翻)进行学习,并学习如何在基于物理引擎的角色身上自然地重现这些动作。
以下是其工作原理,分为简单的几个步骤:
1. “运动词汇表”(将动作转化为文字)
想象一下尝试描述一个复杂的舞蹈动作。如果你试图描述每一个微小的肌肉运动,那会变得非常混乱。相反,GPC 将每一个动作分解为一个简单的“词”或“标记(token)”。
- 创新之处: 以前的方法试图使用一个庞大的字典来编写这些“词”,但这个字典经常变得杂乱无章或丢失页面(这被称为“码本崩溃/codebook collapse”问题)。
- 解决方案: GPC 使用了一种聪明的技巧——FSQ(有限标量量化)。它不是使用一个混乱的字典,而是使用一组固定的“槽位”来存储这些运动词汇。这就像拥有一个非常有序的档案柜,每个文件都有一个特定的、预先分配好的位置。这使得系统更加稳定且更易于训练。
2. “讲述者”(AI 大脑)
一旦系统学会了如何将动作转化为“词”,它就需要学习如何将这些词组合在一起来讲述一个故事。
- 方法: 他们训练了一个 Transformer(与我这样的聊天机器人相同的 AI 大脑类型)来预测序列中的“下一个词”。
- 类比: 把它想象成一个读过数百万本关于人类运动书籍的讲述者。如果角色当前处于站立状态,讲述者会预测:“好吧,接下来的逻辑动作是向前迈一步,”或者“也许是跳一下!”
- 结果: 因为 AI 从如此大量的数据中学习,它不仅仅是在复制动作;它理解其中的“流动感”。如果有人推了一下角色,它会自然地踉跄并恢复平衡,就像真人一样,而不需要专门的指令去执行“从跌倒中恢复”。
3. “专家训练”(适应新工作)
现在,假设你有一个超级智能的角色,它知道如何做任何事情,但你想让它去做一项特定的工作,比如“端着托盘行走”或“跟随特定路径”。
- 问题: 通常,要教给它一项新技能,你必须重新训练整个大脑,这需要耗费极长时间,并且可能会让角色忘记如何自然地行走。
- 解决方案: 论文引入了一种技术,称为 CoLA(条件低秩自适应)。
- 类比: 你不需要重写角色的整个大脑,只需在它的眼睛上添加一副轻便的、小巧的“眼镜”或“滤镜”。这些眼镜告诉角色:“嘿,对于这项特定任务,请专注于这些动作。”
- 益处: 这是极其高效的。它只增加了不到 1% 的新“大脑能力”,却能让角色在保持初始训练中所学到的所有自然、逼真运动的同时,掌握新任务。
他们证明了什么?
- 准确性: 该系统能够以 99.98% 的成功率 重现大规模的运动片段库。它极少无法复制预期的动作。
- 自然度: 当角色被推搡或跌倒时,它不会仅仅僵住或出现故障;它会做出自然的反应(例如,通过翻滚来缓冲跌倒,或调整步伐以保持平衡)。
- 多样性: 他们成功地将这一个预训练模型适配到了许多不同的场景中,比如控制角色转向、跟随路径或跳过障碍物,而无需从头开始。
简而言之: GPC 就像是教一个数字演员阅读大量的运动书籍,将那些动作转化为简单的代码,然后给他们戴上一副用于执行特定场景的“任务眼镜”,同时让他们依然表现得像真实的人类一样。
技术摘要:GPC:用于可迁移运动控制的大规模生成式预训练
问题陈述
开发能够使虚拟角色执行广泛任务并表现出自然、逼真行为的物理驱动控制器,仍然是计算机图形学领域的一项重大挑战。虽然先前的研究利用生成模型(如 VAEs、GANs)从运动数据集中学习运动技能的潜在表示,但这些方法通常依赖于连续的潜在空间。连续空间容易受到模式崩塌(mode collapse)以及由漂移和潜在流形间隙引起的非自然行为的影响。相反,基于向量量化变分自编码器(VQ-VAEs)的离散潜在模型虽显示出潜力,但存在训练退化问题,例如代码使用率低和代码本崩塌(codebook collapse),通常需要复杂的启发式方法(如死代码重新初始化)来缓解。此外,现有的标记化(tokenized)方法大多受限于规模较小的数据集(例如仅包含约 20 小时数据的 AMASS 子集),限制了所学技能的多样性和鲁棒性。
方法论
作者提出了 生成式预训练控制器(Generative Pretrained Controllers, GPC),这是一个利用标记化和下一标记预测(next-token prediction)来创建通用、可重用控制器的框架,旨在处理大规模运动数据集。该框架主要分为三个阶段:
1. 通过有限标量量化(FSQ)进行技能量化
GPC 没有使用 VQ-VAEs,而是采用 有限标量量化(Finite Scalar Quantization, FSQ) 来创建运动技能的离散潜在表示。
- 机制: 编码器将目标状态序列映射为一个连续的潜在向量。每个维度通过舍入操作独立地量化为 L 个固定标量水平,从而创建一个隐含的规模为 Ld 的离散代码本。
- 优势: 这种方法消除了对显式学习代码本的需求,从而无需处理与 VQ-VAEs 相关的代码本嵌入更新、辅助损失函数或即兴启发式方法。
- 训练: 编码器-解码器策略通过带有运动追踪目标的强化学习(近端策略优化,PPO)进行 端到端 训练。这确保了学习到的离散代码能够被物理模拟控制器忠实地执行。
2. 生成式控制器训练
一旦建立了离散技能表示,便会训练一个 GPT 式自回归 Transformer 来建模技能标记(tokens)的分布。
- 标记分组: 为了降低序列长度和计算成本,连续的 L 进制标记被组合成更大的标记,其词表大小为 LG。
- 架构: Transformer 解码器以自回归方式对这些分组后的标记进行建模,并以角色的当前状态和先前生成的标记作为条件。
- 推理: 控制器通过核采样(nucleus/top-p sampling)生成序列化的潜在标记,随后由冻结的 FSQ 解码器将其解码为动作(目标关节旋转),供 PD 控制器使用。
3. 通过参数高效微调(PEFT)进行任务适配
为了将预训练控制器适配到新的下游任务,而无需重新训练整个模型,作者引入了 条件低秩适配(Conditional Low-rank Adaptation, CoLA)。
- 机制: CoLA 在冻结的生成式控制器中插入轻量级调制层(额外参数占比不到 1%)。它扩展了 DoRA 策略,将权重更新分解为幅值和方向分量,并通过特征级线性调制(FiLM)受任务特定观测值的调节。
- 微调策略: 适配可以通过以下方式进行:
- 监督微调(SFT): 利用示例运动在离散潜在代码上最小化交叉熵损失,从而引导控制器偏向任务相关的技能。
- 强化学习微调(RLFT): 使用 PPO 优化特定任务的奖励函数,并通过无条件生成模型进行探索正则化,以保持自然的行为。
核心贡献
- 基于 FSQ 的离散表示: 引入了用于运动技能量化的 FSQ,通过移除显式代码本及相关启发式方法简化了训练,实现了在大规模数据集上的稳定训练。
- 端到端 RL 训练: 一个将量化编码器和解码器与 RL 联合优化的框架,确保潜在空间直接适用于物理控制,不同于以往依赖监督蒸馏的方法。
- 大规模预训练: 成功在一个包含超过 600 小时 多样化人类运动(“Bones” 数据集)的数据集上训练了生成式控制器,其规模显著大于之前的标记化方法。
- 参数高效的适配: 基于 CoLA 的 PEFT 方法允许将预训练控制器适配到各种下游任务(如转向、轨迹跟踪、跌倒恢复),同时保留基础模型所编码的自然、逼真的行为。
结果
- 追踪性能: 基于 FSQ 的追踪控制器在复现来自大规模 Bones 数据集的运动片段方面达到了 99.98% 的成功率,其平均关节位置误差(MPJPE)为 25.56 mm。在成功率和鲁棒性方面,该方法均优于 MLP 基线和基于 VQ-VAE 的控制器。
- 涌现行为: 生成式控制器在没有显式奖励的情况下展现出了自然的涌现行为,包括对扰动的响应行为(例如,调整步幅以恢复平衡)以及跌倒后的恢复策略(例如,通过翻滚爬起)。
- 任务适配: 该框架成功适配了多种下游任务,包括运动(目标到达、轨迹跟踪)和场景交互。
- 多样性: 与确定性基线(如 CVAE)不同,GPC 在执行任务期间保持了行为多样性,即使对于相同的任务也会产生多样的轨迹。
- 风格控制: 监督微调实现了风格控制(例如,强制执行蹲姿行走风格),同时保持了任务性能。
- 效率: 标记分组策略有效地平衡了词表大小与序列长度,在保持运动质量的同时降低了计算成本。
意义与主张
本文声称 GPC 提供了一个 高度鲁棒、通用的控制器,能够模拟极其丰富的运动技能库。通过结合 FSQ、端到端 RL 和自回归建模,该框架克服了连续潜在空间的局限性和 VQ-VAE 的训练不稳定问题。通过 PEFT 进行大规模预训练并高效适配新任务的能力,简化了以往标记化方法的训练过程。作者将 GPC 定位为实现物理驱动角色动画在电影、游戏和 XR 中实际应用的重要一步,在这些领域,角色必须能与动态环境进行真实交互,并能超越手动编写的动画进行泛化。这项工作表明,大规模生成式预训练可以产生不仅能高保真追踪数据,还能表现出类人韧性与适应性的控制器。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。