GenTrack: Physical Alignment for Robot-Native Motion Generation and Zero-Shot Humanoid Tracking
GenTrack 引入了一种在线生成器-追踪器框架,该框架在基于执行的运动生成与追踪器训练之间交替进行,以有效地缩小运动在运动学合理性与机器人可执行性之间的差距,从而在无需额外数据采集的情况下,实现对多样化且分布外参考序列卓越的零样本类人机器人追踪。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图教一个机器人跳舞。你有两种主要的方法。第一种方法是记录人类舞者的动作,并将他们的动作复制到机器人身上,并寄希望于机器人的腿部和关节能够承受这些步骤。问题在于,人类和机器人的构造不同;人类的一个动作在视觉上可能很流畅,但对机器人来说可能会导致绊倒、摔倒或关节损坏。第二种方法是让计算机程序根据文本描述(例如“做一个旋转跳跃”)从零开始发明新的舞蹈动作。但如果计算机仅从人类数据中学习,它可能会发明出在屏幕上看起来很酷、但在物理上机器人无法执行的动作。
为了让机器人真正有用,它需要能够通过阅读描述即时学习新技巧,而不需要人类先进行物理演示每一个动作。这被称为“零样本”(zero-shot)学习。巨大的挑战在于弥合“机器人应该做什么”(计划)与“机器人实际能做什么”(物理特性)之间的鸿沟。如果计划太难,机器人会崩溃;如果计划太容易,机器人就学不到任何新东西。科学家们一直在努力研究如何生成既具有创造力又在物理上安全、可供机器人执行的舞蹈动作。
这就是名为 GenTrack 的新方法发挥作用的地方。把 GenTrack 想象成一个高科技舞蹈工作室,两个截然不同的机器人在其中通过一个持续的循环相互学习。在这一侧,你有一个生成器(Generator),这是一个基于文本提示发明新舞蹈动作的创意 AI;在另一侧,你有一个追踪器(Tracker),这是一个尝试在物理上执行这些动作的熟练机器人。
在旧的方法中,这两者是分开工作的。生成器根据人类数据制作动作,而追踪器则尝试跟随这些动作。如果追踪器失败了,生成器并不知道它为什么失败,而追踪器只会不断尝试跟随错误的指令。这就像一位从不观察学生练习的舞蹈教练;他们只是不断地喊出新的动作,却没意识到学生正被自己的脚绊倒。
GenTrack 通过让它们成为一个实时共同学习的团队改变了游戏规则。这个循环是这样运作的:
- 生成器根据文本提示创建一个新的舞蹈动作。
- 追踪器尝试在模拟环境中的真实机器人(具体为 Unitree G1 机器人)上执行该动作。
- 反馈: 如果追踪器踉跄、滑倒或摔倒,它会向生成器发送一个信号。这就像学生在说:“嘿,那个旋转对我的腿来说太快了!”
- 更新: 生成器倾听这种反馈,并调整其未来的动作,使其对机器人更加友好。与此同时,追踪器从这些新的、虽然仍具挑战性但稍微容易一些的动作中学习,从而变得能够更好地遵循它从未见过的指令。
研究人员使用两种不同的追踪器“大脑”(称为 ProtoMotions 和 SONIC)测试了这个系统,并发现这种前后的互动学习效果惊人。在他们的模拟中,GenTrack 系统产生的机器人能够成功跟随比以前更广泛多样的舞蹈动作。例如,使用 SONIC 大脑时,机器人在跟随困难且未见过的动作方面的成功率从大约 85% 跳升至 90%,且在匹配预期路径方面的误差显著下降。
至关重要的是,该论文反对另外两种常见的方法。首先,仅仅重复使用一组固定的预制动作(静态回放)效果并不好,因为随着机器人的进步,动作并不会随之调整。其次,仅仅通过一个单一的、固定的机器人大脑进行过滤(单向过滤)会导致生成器只产生机器人已经能够完成的最简单的动作,这降低了创造力和多样性。GenTrack 通过让生成器和追踪器共同进化,避开了这些陷阱。
结果表明,这种“在线协同训练”(online co-training)有助于机器人理解什么是“纸面上看起来很好”以及什么是“物理上实际可执行”的动作。生成器学会了创建对机器人而言在物理上合理的动作,而追踪器学会了处理更广泛、更具原创性的指令。虽然这项研究是在模拟中进行的,但研究结果表明,这种协作循环是教机器人学习新技能的一种强大方式,而无需依赖数百万小时昂贵的人类现实演示。这是迈向让机器人能够真正随着任何旋律起舞——而不只是跳那些最初教给它们的舞步——的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。