← 最新论文
🤖 machine learning

GPC: Large-Scale Generative Pretraining for Transferable Motor Control

本文介绍了生成式预训练控制器(Generative Pretrained Controllers, GPC),这是一个将标记化的运动表示与自回归下一标记预测以及强化学习相结合的框架,旨在创建鲁棒且通用的控制器,使其能够重现海量的运动数据集,并能以自然、涌现的行为适应多样化的下游任务。

原作者: Yi Shi, Yifeng Jiang, Chen Tessler, Xue Bin Peng

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yi Shi, Yifeng Jiang, Chen Tessler, Xue Bin Peng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一个数字角色(比如视频游戏中的化身)如何移动。传统上,你可能必须手动编写每一次肌肉抽动来完成行走、跳跃或跌倒。或者,你可以使用一个“老师”来向角色展示如何移动,但角色经常会感到困惑、忘记所学的内容,或者开始做出一些奇怪、不自然的动作。

这篇论文介绍了一种名为 GPC (Generative Pretrained Controllers,生成式预训练控制器) 的新系统。可以将 GPC 想象成一个“超级智能运动库”,它通过观察超过 600 小时 多样化的人类运动(从行走、跑步到翻滚和空翻)进行学习,并学习如何在基于物理引擎的角色身上自然地重现这些动作。

以下是其工作原理,分为简单的几个步骤:

1. “运动词汇表”(将动作转化为文字)

想象一下尝试描述一个复杂的舞蹈动作。如果你试图描述每一个微小的肌肉运动,那会变得非常混乱。相反,GPC 将每一个动作分解为一个简单的“词”或“标记(token)”。

  • 创新之处: 以前的方法试图使用一个庞大的字典来编写这些“词”,但这个字典经常变得杂乱无章或丢失页面(这被称为“码本崩溃/codebook collapse”问题)。
  • 解决方案: GPC 使用了一种聪明的技巧——FSQ(有限标量量化)。它不是使用一个混乱的字典,而是使用一组固定的“槽位”来存储这些运动词汇。这就像拥有一个非常有序的档案柜,每个文件都有一个特定的、预先分配好的位置。这使得系统更加稳定且更易于训练。

2. “讲述者”(AI 大脑)

一旦系统学会了如何将动作转化为“词”,它就需要学习如何将这些词组合在一起来讲述一个故事。

  • 方法: 他们训练了一个 Transformer(与我这样的聊天机器人相同的 AI 大脑类型)来预测序列中的“下一个词”。
  • 类比: 把它想象成一个读过数百万本关于人类运动书籍的讲述者。如果角色当前处于站立状态,讲述者会预测:“好吧,接下来的逻辑动作是向前迈一步,”或者“也许是跳一下!”
  • 结果: 因为 AI 从如此大量的数据中学习,它不仅仅是在复制动作;它理解其中的“流动感”。如果有人推了一下角色,它会自然地踉跄并恢复平衡,就像真人一样,而不需要专门的指令去执行“从跌倒中恢复”。

3. “专家训练”(适应新工作)

现在,假设你有一个超级智能的角色,它知道如何做任何事情,但你想让它去做一项特定的工作,比如“端着托盘行走”或“跟随特定路径”。

  • 问题: 通常,要教给它一项新技能,你必须重新训练整个大脑,这需要耗费极长时间,并且可能会让角色忘记如何自然地行走。
  • 解决方案: 论文引入了一种技术,称为 CoLA(条件低秩自适应)。
  • 类比: 你不需要重写角色的整个大脑,只需在它的眼睛上添加一副轻便的、小巧的“眼镜”或“滤镜”。这些眼镜告诉角色:“嘿,对于这项特定任务,请专注于这些动作。”
  • 益处: 这是极其高效的。它只增加了不到 1% 的新“大脑能力”,却能让角色在保持初始训练中所学到的所有自然、逼真运动的同时,掌握新任务。

他们证明了什么?

  • 准确性: 该系统能够以 99.98% 的成功率 重现大规模的运动片段库。它极少无法复制预期的动作。
  • 自然度: 当角色被推搡或跌倒时,它不会仅仅僵住或出现故障;它会做出自然的反应(例如,通过翻滚来缓冲跌倒,或调整步伐以保持平衡)。
  • 多样性: 他们成功地将这一个预训练模型适配到了许多不同的场景中,比如控制角色转向、跟随路径或跳过障碍物,而无需从头开始。

简而言之: GPC 就像是教一个数字演员阅读大量的运动书籍,将那些动作转化为简单的代码,然后给他们戴上一副用于执行特定场景的“任务眼镜”,同时让他们依然表现得像真实的人类一样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →