想象一下,你正试图教一群形态各异的机器人跳舞。其中一个机器人看起来像人类,另一个稍微高一些且身材瘦长,第三个则比较矮胖。通常情况下,如果你想让它们模仿一个舞蹈动作,你必须分别教每一个机器人,或者你必须把舞蹈拆解成“手臂动作”和“腿部动作”来分段教学。
这篇论文介绍了 VENOM(全能躯体运动追踪的多功能具身网络),它就像是一个“全能舞蹈老师”,可以同时处理所有这些不同的机器人,而无需将舞蹈拆解成碎片。
以下是它的工作原理,使用了简单的类比:
1. 问题所在:“专家型”与“通用型”
大多数之前的机器人学习方法更像是专家型导师。如果你想让机器人走路,你就请一位走路教练;如果想让它挥手,你就请一位挥手教练。如果你有一个身体形状略有不同的新机器人,旧教练就不知道该如何教它。这些方法通常不得不将机器人的身体拆分为“上半身”和“下半身”,以简化数学计算,但这限制了动作的表现力和自然度。
2. 解决方案:VENOM,机器人的“舞蹈版 GPT”
作者使用了一种被称为 Transformer 的 AI 架构构建了 VENOM(这也是聊天机器人如 GPT 背后的技术)。
- 类比: 把 VENOM 想象成一个读过海量舞蹈视频的超级聪明学生。它不是在为特定的机器人死记硬背某一个舞蹈,而是学习了“运动的概念”。
- 神奇之处: 因为它基于这种“GPT”风格,它可以观察一个舞蹈动作并判断:“好吧,我知道如何在长腿机器人上做这个动作,我也知道如何将同一个动作适配给矮胖机器人。”它不需要将身体拆分为上下部分;它将整个身体视为一个连接的整体。
3. 训练数据:“练习室”
为了教导 VENOM,研究人员创建了一个庞大的数据集,称为 VENOM 数据集。
- 制作方式: 他们提取了现有的“专家级”机器人(通过一种被称为强化学习的非常复杂的不同方法训练而成),并让它们在五种不同类型的机器人上执行了数千小时的舞蹈动作。
- “噪声”因素: 至关重要的一点是,他们并没有只给 VENOM 展示完美的视频。他们还展示了机器人有些摇晃或传感器有点模糊的视频(加入了“噪声”)。
- 结果: 这就像一个学生不仅在完美的舞池中练习,还在一个湿滑、不平整的地面上练习。这使得 VENOM 更加鲁棒(稳健)。当它在现实世界中尝试跳舞时,它不会那么容易摔倒,因为它已经习惯了处理各种不完美的情况。
4. 结果:足以媲美专家
研究人员将 VENOM 与另外两组进行了对比测试:
- “老派”老师: 简单的神经网络(MLP),它们在相同的数据上进行训练,但没有“GPT”那样的脑力。
- “精英”专家: 最初通过复杂的、基于奖励的强化学习方法训练出来的机器人。
发生了什么?
- VENOM 对阵 老派老师: VENOM 彻底碾压了那些简单的老师。它追踪舞蹈动作的准确度更高,且能让机器人保持稳定。
- VENOM 对阵 精英专家: 这是最令人惊讶的部分。VENOM 是使用监督学习(仅仅是观察和模仿)训练的,而“专家”则是通过强化学习(通过奖励进行的试错法)训练的。通常情况下,通过“试错”训练出的专家才是稳定性的王者。
- 发现: VENOM 的表现极其接近这些专家。即使在训练过程中从未收到过“奖励”或“惩罚”——它只是通过模仿学习——它追踪动作的效果也几乎达到了专家的水平。
- 不足之处: 在进行非常剧烈、动态的动作(如跳跃或蹦跳)时,专家们在保持平衡方面仍然略胜一筹。VENOM 在这些高能量时刻有时难以保持完美的直立状态,但其表现依然令人印象深刻。
5. 核心结论
该论文声称 VENOM 是一项突破,因为它证明了你可以构建一个单一的、统一的模型,在无需拆分身体部位的情况下,同时控制多种不同的机器人躯体。
- 它具有多样性: 它适用于 5 种不同类型的机器人。
- 它具有表现力: 它能处理复杂的全身舞蹈,而不只是走路。
- 它很高效: 它能获得几乎与最昂贵、最复杂的训练方法相近的效果,但它仅仅是通过“观察和模仿”(监督学习),而不是通过“尝试与失败”(强化学习)。
简而言之,VENOM 是迈向未来的一步,在那个未来,一个 AI 大脑可以控制一整个不同的机器人家族,让它们和谐地起舞、行走和运动。
技术摘要:VENOM —— 用于全方位人体运动追踪的多样化具身网络
问题陈述
仅依靠演示数据在多种人形机器人上实现专家级、表现力强的全身运动追踪,仍然是机器人学习领域的一项重大挑战。目前的跨具身方法通常将控制解耦为上肢和下肢部分,或者依赖于需要特权信息的非对称演员-评论家(actor-critic)强化学习(RL)框架。此外,缺乏大规模、低层级的多样化人形机器人控制数据集,限制了通用基础模型的训练。现有模型往往局限于运动任务,或者在没有手动对齐观测与动作空间的情况下,无法在不同具身形态之间进行有效泛化。
方法论
VENOM 数据集
作者策划了一个新的多人形机器人运动追踪数据集 —— VENOM 数据集,以解决大规模低层级控制数据匮乏的问题。
- 源数据: 该数据集使用 TWIST2 训练框架(一种基于强化学习的运动追踪流水线)生成,用于在五种不同的人形机器人(Unitree G1, Unitree H1, Unitree H1 v2, Fourier N1, 以及 Booster T1 [29 DoF])上训练专家追踪器。
- 数据生成: 专家在整个 AMOSS 数据集上进行训练。对于每段运动,专家生成一个干净的展开(rollout)和八个带有噪声的展开。噪声被应用于观测空间中的参考运动(根部位置、朝向、速度和关节位置)。
- 规模: 该数据集包含约 7,705 小时的数据,以 6 秒为一个片段进行划分,包含状态、动作和奖励。
模型架构 (VENOM)
VENOM 是一个基于 GPT(Transformer) 的运动追踪器,旨在实现跨多种人形机器人的全身控制。
- 架构: 核心控制器由 8 层 Transformer 层组成,具有 8 个注意力头,嵌入维度为 768。它采用统一架构,不将上肢和下肢控制进行解耦。
- 输入处理: 模型采用特定的编码器来处理参考运动:
- 运动编码器 (Motion Encoder): 编码 1 步参考运动。
- 历史编码器 (History Encoder): 使用一维卷积编码 10 步参考运动历史。
- 未来编码器 (Future Encoder): 使用 MLP 编码 1 步未来参考运动。
- 多具身处理: 模型为每种人形机器人使用不同的 Token 嵌入层和动作头。在训练期间,来自所有人形机器人的输入沿批次维度(batch dimension)进行拼接,并输入到共享的 Transformer 解码器中。在推理期间,只有对应目标人形机器人的特定输入模块和动作头处于激活状态。
- 训练目标: 模型通过监督学习进行训练,旨在最小化预测动作与专家动作之间的均方误差 (MSE)。它在干净和带噪声的展开数据上进行训练,以提高鲁棒性。
基线模型 (Baselines)
本研究将 VENOM 与以下模型进行对比:
- TWIST2 基线: 使用 VENOM 数据集训练的基于 MLP 的模型(针对单个或多个机器人),采用相同的监督学习框架。
- RL 专家: 直接在 RL 环境(TWIST2 框架)中训练的非对称演员-评论家模型,作为性能的上限。
关键结果
规模化与架构
- 多机器人泛化: 当在多个机器人上进行训练时,基于 MLP 的 TWIST2 基线出现了负迁移现象,无法在追踪参考运动的同时稳定机器人。相比之下,基于 Transformer 的 VENOM 成功实现了跨不同具身形态的泛化。
- 噪声鲁棒性: VENOM-noisy 模型(使用带噪声的展开数据训练)在运动追踪能力上优于仅使用干净数据的模型。噪声的引入使策略暴露在未被充分探索的观测区域,从而增强了鲁棒性。
- 性能指标: 在 Unitree G1 上,VENOM-noisy 实现的关节追踪均方根 (RMS) 误差为 0.1052 弧度,优于多机器人 MLP 基线 (0.1686),并达到了单机器人 MLP 基线 (0.1067) 的水平。
运动追踪与稳定性
- 关节追踪: 在各种行为类别(竞技、蹲伏、舞蹈、跳跃、运动)中,VENOM 模型在关节追踪精度上始终优于多机器人 MLP 基线。
- 稳定性 vs. 监督学习: 虽然 VENOM-noisy 实现了较高的成功率 (92–100%) 且相比其他监督学习模型漂移更低,但它并未完全达到 RL 专家的运动稳定性。RL 专家实现了更高的成功率和更低的根误差率,这表明在仅依赖监督学习而缺乏奖励反馈时,存在运动保真度与稳定性之间的权衡。
- 局限性: 包括 RL 专家在内的所有模型,在处理涉及飞行阶段(如跳跃、冲刺)的高度动态运动时都遇到了困难,通常会学习通过保持地面接触的行为来确保稳定性。
重要性与主张
论文将 VENOM 定位为首个无需解耦上下肢控制的多人形机器人全身运动追踪模型。其主要贡献包括:
- 数据集策划: 创建了 VENOM 数据集,这是一个通过专家模仿生成的、大规模、多具身的运动数据集,可作为训练通用运动追踪器的基础。
- 基础模型的可行性: 证明了基于 GPT 的基础模型通过在多样化、带噪声的数据上进行监督学习,可以实现超越传统 MLP 基线的跨具身全身运动追踪能力。
- 监督学习与 RL 的差距: 量化了监督学习与 RL 专家之间的差距。作者表明,虽然监督学习可以恢复大部分专家能力,但目前在运动稳定性方面仍需做出妥协,尤其是在高度动态的任务中。
作者总结道,尽管 VENOM 代表了迈向通用低层级控制的重要一步,但未来的工作应探索直接针对运动追踪的 RL 训练、用于处理任意形态的在线重定向策略(online retargeting policies),以及改进针对动态飞行阶段运动的预测时界(prediction horizons)。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。