Ground-JEPA: Learning Physically Grounded Latent World Models for Zero-Shot Dynamics Generalization of Legged Robots
Ground-JEPA 引入了一种极简的、基于物理规律的潜在世界模型,该模型在无需依赖特定任务奖励的情况下,实现了高自由度环境下足式机器人的零样本动力学泛化和卓越的控制性能,从而挑战了“无奖励学习对于复杂机器人系统本质上更差”这一假设。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机器人的内在指南针
想象一下,你正试图教一个机器人走过一片多石的地带。你可以给它一套严格的规则,比如“抬脚正好10厘米”,但现实世界是混乱的:石头会移动,地面会打滑,机器人的腿可能比预想的要重一些。这就是**足式机器人控制(legged robot control)**的挑战:让机器在不可预测的环境中平稳且安全地移动。长期以来,科学家们一直试图通过构建“动力学模型”来解决这个问题——这本质上是在机器人内部建立一张心理地图,用来预测如果它以某种方式移动,接下来会发生什么。
传统上,这些心理地图是通过奖励机器人做出的好事(如保持直立)并惩罚其做出的坏事(如跌倒)来构建的。这被称为基于奖励的学习(reward-based learning)。然而,这里有一个陷阱:如果机器人在预测中出现了一个微小的错误,这个错误会随着时间的推移不断累积,就像滚下山坡的雪球一样,直到机器人的心理地图完全出错并导致崩溃。另一种被称为**联合嵌入预测架构(Joint-Embedding Predictive Architectures, JEPA)**的方法,试图跳过现实世界中那些杂乱的细节。它不再预测机器人摄像头中每一个像素点的精确位置,而是预测一个压缩后的“摘要”或“潜空间(latent)”版本的未来。这就像音乐家通过感受节奏来预测下一段音符,而不是去计算空气的精确振动。科学家们一直在问的一个大问题是:机器人是否可以仅仅通过理解这种内在的节奏,而不需要老师不断告诉它“做得好”或“再试一次”,就能学会完美地行走?
Ground-JEPA:通过感受节拍学习行走的机器人
研究人员推出了一种名为 Ground-JEPA 的新系统,该系统表明,机器人可能并不需要不断的赞扬或惩罚来学习复杂的动作。相反,它们可以通过尝试让其内在对未来的“感觉”与现实保持一致来学习。
想象一下,机器人学习走路不是因为被告知“不要摔倒”,而是通过尝试确保其内在的“我在哪里,我要去向何方”的感觉与其实际运动相匹配。在这个新系统中,机器人并不试图重建未来的完美视频。相反,它将经验压缩进一个微小、高效的“潜空间”中——一种抽象的心理简写。这里的核心技巧是一个受物理启发探测器(physics-inspired probe)。虽然机器人的内部地图是抽象的,但这个探测器充当了翻译官的角色,将那些抽象的思想转化回现实世界的物理量,如位置、速度和朝向。这就像是一个思维纯粹由概念构成的机器人,却拥有一个内置的翻译器,确保这些概念仍然遵循重力和动量的定律。
研究人员发现,成功的秘诀不仅在于这种转化,还在于规划视野(planning horizon)。之前的尝试之所以失败,是因为机器人只向前看几步——就像通过只盯着自己的脚尖来走路。Ground-JEPA 系统迫使机器人向更远的前方看,具体来说是看12步之后。这至关重要,因为一个完整的行走周期(步态)大约需要这么长。通过观察整个周期,机器人可以看到运动的“大局”,而不仅仅是优化下一个微小的步伐。这使得系统能够纯粹通过**自监督(self-supervision)**学习稳定的行走模式,这意味着它通过检查其内部预测是否一致来进行学习,而不需要任何外部奖励。
他们在模拟实验中的结果非常令人惊讶。在一个模拟四足机器人(quadruped)上,这个无需奖励的系统达到了 510 ± 68 的性能得分,这实际上优于传统的基于奖励的系统(得分为 450 ± 234)。更令人印象深刻的是,他们首次成功将其应用于模拟的人形机器人(具有人类体型的机器人),在没有任何奖励信号的情况下达到了 350 ± 50 的得分。在这样的设置下,传统方法在人形机器人上完全失败了。
最令人兴奋的发现之一是该系统处理“极端”变化的能力。研究人员测试了物理环境发生剧烈变化的场景:机器人的质量改变了 ±30%,地面摩擦力增加了 2.5 倍或减少到 0.4,以及电机存在 50 毫秒的延迟。在一个所有这些变化同时发生的复合场景中,Ground-JEPA 模型保留了其原始性能的 78%。相比之下,传统的基于奖励的模型,即使在经过随机变化训练后,也仅保留了 21% 的性能。这表明,通过学习运动的基本“流形(manifold)”或形状,机器人变得更加鲁棒,能够应对世界的变化。
团队还发现,模型的规模并不需要非常庞大。整个系统可以在笔记本电脑的 GPU 上运行,仅使用约 130 万个参数,这与需要数十亿参数的其他大型 AI 模型相比非常微小。他们证明了以往研究中看到的“崩溃”(即机器人停止学习)并不是因为方法本身有缺陷,而是因为机器人使用了错误的内部地图(具体来说是一种被称为 SimNorm 的归一化地图)并且在没有正确结构的情况下看得太远。通过使用原始潜表示和正确的规划视野,该系统运作得非常出色。
然而,作者谨慎地指出,这些结果目前仅基于模拟。虽然机器人在一个物理特性发生剧烈变化的虚拟世界中学会了行走,但该系统尚未在现实世界的物理机器人上进行测试。此外,虽然他们解决了人形机器人站立的问题,但由于单脚平衡的复杂物理机制,让人形机器人进行动态的双足行走仍然是一个挑战。
最终,Ground-JEPA 指明了机器人技术的一条新路径:我们可能不需要花费数月时间设计完美的奖励函数来教机器人走路,我们只需要教它如何让其内在的节奏与物理定律保持一致。这可能会使先进的机器人控制实现民主化,让使用标准笔记本电脑的小型实验室也能构建出能够适应现实世界的机器人,而无需依赖庞大的超级计算机或无止境的试错奖励。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。