想象一下,你正在教一个机器人跳舞、格斗或做体操。通常,你会通过向它展示成千上万段人类进行这些活动的视频来实现。但这种方法存在两个大问题:
- “简单模式”陷阱:我们拥有的大多数视频都是人们走路、挥手或执行简单日常任务的片段。机器人对这些非常擅长,但当你要求它做后空翻或复杂的武术踢腿时,它会摔倒,因为它在训练中从未见过这些动作。
- “昂贵教练”问题:要获取专家执行酷炫高难度动作的视频,你需要昂贵的动作捕捉服和专业工作室。你无法拍摄数百万小时的这类内容;这既耗资巨大又耗时。
解决方案:一个自我进化的“电子游戏”循环
本文作者 CLAIMS 构建了一个系统,其运作方式如同一个机器人和游戏关卡共同进化的电子游戏。
以下是其工作原理,使用一个简单的类比:
1. 机器人(玩家)
将机器人视为一个电子游戏角色。它的任务是完美地模仿特定的动作。
2. AI 导演(游戏设计师)
团队不使用人类来拍摄新动作,而是利用一个 AI“导演”(一个动作生成模型)。这位导演只需阅读文字描述(例如“高速三圈旋转”),就能发明新的舞蹈动作、武术连招或体操套路。
3. “教练”(反馈循环)
这是神奇的部分。系统在一个循环中运行:
- 步骤 1:导演生成一个新的、略微棘手的动作。
- 步骤 2:机器人尝试模仿它。
- 步骤 3:“教练”(一个能够观看并理解视频的智能 AI)观察机器人。它会问:“机器人摔倒了吗?这个动作是否太简单了?它看起来像描述的那样吗?”
- 步骤 4:根据教练的报告,导演获得新的指令:“机器人已经掌握了简单的跳跃。现在,生成一个难度增加 20% 且涉及旋转的动作。”
4. 结果:一个“升级”系统
就像在游戏中你通关后下一关会变得更难一样,这个系统不断推动机器人进步。
- 迭代 1:机器人学会走路和做简单的转身。
- 迭代 2:系统意识到机器人已熟练掌握这些,于是生成更难的动作(如侧手翻)。
- 迭代 3:机器人掌握了侧手翻,因此系统生成“带旋转的后空翻”。
由于该系统自动生成其自身的“更高难度关卡”,它不需要昂贵的人类教练或庞大的预录视频库。它构建了自己的训练课程。
他们取得了什么成就?
团队在一个从零开始学习的机器人上测试了该系统。
- 效率:他们仅使用了通常所需数据量的十分之一(与 AMASS 等标准数据集相比)。
- 性能:在他们的“游戏”结束时,与采用传统方法训练的机器人相比,该机器人在高难度专业动作(如功夫或复杂舞蹈)上的失败率降低了 45%。
- 通用性:他们证明了该方法适用于多种不同类型的困难动作,包括武术、舞蹈、格斗、运动和体操。
核心结论
与其试图在库中寻找所有可能的困难动作(这既不可能又昂贵),本文提出了一种自动驾驶训练循环。它生成机器人需要学习的困难动作,测试机器人,然后根据机器人刚刚学到的内容立即生成更难的动作。这是一种无需满场人类专家,就能将机器人培养成专业运动员的方法。
技术摘要:用于扩展人形机器人控制能力的迭代闭环运动合成
问题陈述
基于物理的人形机器人控制严重依赖具有多样化数据分布的运动数据集进行训练。然而,现有方法面临两个主要局限:
- 固定难度分布:标准数据集(如 AMASS)通常表现出固定的分布,偏向低动态的日常生活活动。这限制了训练所得控制策略的性能上限,导致其在处理高动态的专业技能(如杂技或武术)时失效。
- 可扩展性与成本:通过动作捕捉(MoCap)系统获取高质量的专业运动数据成本高昂,使得大规模扩展变得困难。现有通过视频挖掘或跨具身聚合进行扩展的尝试,往往缺乏可靠的语义对齐或难度分层。
因此,在静态、低动态语料库上训练的控制策略难以泛化到未见过的、高动态的专业运动。
方法论:CLAIMS 框架
作者提出了 CLAIMS(闭环自动化迭代运动合成),这是一个协同演化运动数据合成与控制策略优化的框架。该系统作为一个竞争性迭代循环运行,旨在逐步扩展控制器的能力边界。
1. 语义定义与归一化
为了解决结构化高动态数据的缺失,作者为五个专业领域的动作数据定义了语义分类体系:武术、舞蹈、格斗、运动和体操。难度沿四个维度形式化:
- 基础动作:原子技能。
- 组合动作:组合逻辑。
- 细节:技术提示(例如肢体放置)。
- 速度与节奏:时间结构。
2. 自动化数据生成
该框架利用预训练的文本条件运动扩散模型(MDM)以低成本合成运动数据。
- 提示工程:系统不使用自由形式的描述,而是使用源自语义分类体系的模板化动作提示。辅助大语言模型(LLM)将这些模板实例化为具体的难度属性。
- 过滤:生成的运动经过有效性检查(例如根关节高度边界以防止漂浮或下沉),并使用视觉 - 语言模型(VLM)进行语义对齐检查,以确保运动与提示匹配。
- 分布偏移:系统有意从“难度感知变量库”中采样,以激发超出 MDM 原始训练分布(HumanML3D/AMASS)的行为,生成新颖的专业组合。
3. 控制器训练与评估
单个原语跟踪器(基于 PHC)通过在合成数据上进行强化学习(RL)进行训练。评估阶段对循环至关重要:
- 客观指标:系统计算物理跟踪指标,包括平均关节位置误差(mpjpe-g/l)、速度差异(vel-dist)和加速度差异(accel-dist)。
- 主观指标:VLM(GPT-4o 和 Qwen-VL-MAX)分析渲染的运动序列,提供关于技术复杂性、平衡性和连续性的主观难度评分和描述符。
4. 竞争性迭代循环
核心创新在于竞争性课程:
- 在每个训练周期后,系统评估控制器的性能。
- 如果客观指标超过预定义阈值,则当前数据分布被视为“已掌握”。
- LLM 策略(使用思维链)分析结合客观和主观反馈,为下一次迭代生成更难的提示。
- 这形成了一个自我强化的循环,数据难度随着控制器能力的增长而升级,推动策略超越其原始限制。
主要贡献
- 可扩展的、难度分层的数据集:作者提出了一种方法,用于生成在五个专业领域具有清晰难度层级的可扩展数据集,在保持运动 - 文本对齐的同时引入高动态复杂性。
- 竞争性迭代框架:一种在游戏化设置中交替进行数据生成和控制器优化的框架。这使得策略能够通过与数据协同演化,突破固定语料库的难度上限。
- 控制器无关的高效性:该框架仅需为控制器提供训练计算资源;数据生成和评估组件无需训练且成本低廉,使得该方法适用于各种跟踪架构。
实验结果
该框架使用 PHC 单原语跟踪器进行评估,其训练数据规模约为 AMASS 数据集的 1/10,但具有迭代式的难度升级。
- 性能提升:在四个基准测试(Motion-X/Kungfu、EMDB、AIST++、Video-Convert)的 2,201 个片段测试集上,最终迭代模型(L6)的平均成功率达到 76.9%,而 AMASS 基线为 58.3%。这代表了平均失败率降低了 45%。
- 泛化能力:该框架展示了在未见过的动态数据上的强泛化能力。即使使用非迭代基线(Loop 0),该系统也优于在通用语料库上的标准训练。随后的循环(Loop 1+)显示出一致的改进。
- 跨范式有效性:该方法成功应用于 MaskedMimic 控制器,证明了反馈驱动、提示条件化的优化可以转移到不同的模仿学习框架中。
- 消融研究:
- VLM 可靠性:VLM 难度评分与物理指标(速度)呈单调相关,验证了自动评分的有效性。
- 观测必要性:移除物理指标或 VLM 反馈中的任一项都会降低性能,其中物理指标对于挑战设计最具诊断价值。
- 变量库:移除结构化变量库会导致性能下降,证实了需要结构化先验来稳定提示生成。
- 迭代与规模:规模匹配的非迭代基线(随机采样相同总量的数据)表现不如迭代方法,证实了收益源于课程效应,而不仅仅是数据量。
意义与主张
本文主张,CLAIMS 为将基于物理的人形机器人控制推进至高动态和多样化场景提供了一条新途径,无需依赖昂贵的 MoCap 数据。通过建立数据 - 控制器协同演化范式,该框架:
- 克服了固定难度语料库的局限性。
- 实现了在专业、高难度运动基准上的稳定性能提升。
- 提供了一条低成本、自动化的流水线,可集成到现有的跟踪架构中。
作者承认了局限性,指出合成质量受限于生成模型对极端动态的建模能力,且当前的变量库需要人工策展。然而,他们提出模块化架构允许无缝集成未来更强大的生成器和自动化库。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。