Asymmetric physics enables efficient learning in quadrupedal robot swarms
本文证明了利用非对称物理学——即将用于实现逼真接触动力学的高保真不可微模拟器与用于基于梯度的学习的可微代理模型相结合——能够为大规模四足机器人集群实现基于视觉的去中心化控制策略的高效端到端训练,并在无需显式通信或全局地图的情况下,实现向真实世界环境的鲁棒零样本迁移。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你要教一群由 500 只鸟组成的鸟群如何在茂密的森林中飞行,而不撞到树木或彼此碰撞。如果你尝试逐一教它们,或者试图给它们一张地图和一个中央指挥官,这种方法会非常缓慢、笨拙,且无法在现实世界中有效运作。
这篇论文描述了一项突破,它教会了机器人狗(四足机器人)如何做到这一点:仅靠它们自己的眼睛,在不进行通信或不跟随领导者的情况下,作为一个集群在混乱、拥挤的环境中协同移动。
以下是他们实现这一目标的简单拆解:
问题所在:“黑盒”机器人集群
通常,当科学家使用人工智能(特别是强化学习)训练机器人时,他们使用一种称为“试错法”的方法。机器人尝试某种动作,撞车,意识到这是错误的,然后再次尝试。
- 问题在于: 当你只有一个机器人时,这没问题。但当你同时拥有数百个机器人移动时,“试错”就变成了一场噩梦。计算机在试图弄清楚哪个机器人做了什么操作时会变得不堪重负,学习过程极其缓慢且效率低下。这就像试图通过一次掉落一个球的方式来学习同时抛接 500 个球一样。
解决方案:“双脑”妙招
研究人员想出了一个巧妙的方法,利用他们称之为**“非对称物理学”(Asymmetric Physics)**的技术来加速这一过程。可以将其理解为为机器人集群提供了两个不同的“大脑”,分别承担两项不同的工作:
- “现实主义者”大脑(用于行动): 当机器人在实际移动并进行交互时,它们使用一个超详细的高保真模拟器。这个大脑看到的物理世界是完全真实的:凹凸不平的地面、草丛、碰撞,以及机器人腿部击中泥土时的复杂物理反应。它是真实的,但对于数学计算上的学习过程来说过于复杂。
- “简化者”大脑(用于学习): 当计算机需要计算如何改进时,它会切换到一个简化的、“卡通版”的物理版本。它不再模拟每一块肌肉或每一块石头,而是将机器人视为简单的移动点(用于导航)或刚性块(用于运动)。这个简化版本非常平滑,易于计算机计算梯度(即告诉机器人如何变得更好的数学逻辑)。
类比: 想象一名飞行员正在学习驾驶飞机。
- “现实主义者” 是带有风力、湍流和引擎噪音的真实飞行模拟器。
- “简化者” 是白板上的一幅展示飞机路径的基础绘图。
- 飞行员在真实的模拟器中练习(以获得手感),但教练使用白板来快速解释飞行员为什么犯错以及如何修正。这篇论文自动完成了这一过程:机器人在现实世界中“行动”,但从简化的数学逻辑中“学习”。
他们取得了什么成就
利用这种方法,团队训练出了一个能够同时控制多达 512 只机器人狗 的单一 AI 策略。
当他们在现实世界中使用 六只 Unitree Go2 机器人狗 进行测试时,结果令人惊讶。这些机器人没有中央指挥官,没有用于互相通信的 Wi-Fi,也没有区域地图。它们只有鼻子上的一个摄像头。然而,它们的行为就像协调一致的动物群落:
- 右侧避让: 当两组机器人迎面相遇时,它们会自然地向右偏移以彼此错开,就像汽车或行人通行规则一样。
- 预测性规避: 如果它们看到有另一个机器人正在靠近,它们会在进入狭窄间隙之前减速或停顿,从而防止交通拥堵。
- 沿墙移动: 如果它们被卡住或看不清路径,它们会自然地沿着墙壁滑动,直到找到开口。
- 人群流动: 即使是在完全自主学习的情况下,它们也能在茂密的森林、狭窄的桥梁和迷宫中穿行而不发生碰撞。
为什么这很重要
论文声称,这是首次实现基于视觉的学习在如此复杂的物理环境中,在足式机器人集群中达到如此高水平的表现。
核心要点在于,通过将“真实的行动”与“简化的学习”分离,他们将一个庞大且缓慢的问题(教导 500 只机器人)转化为了一个高效的过程。他们并没有编程让机器人去执行“向右让行”或“等待他人”,相反,他们创建了一个训练环境,使得这些行为自然而然地产生,因为这是机器人达到目标最有效率的方式。
简而言之:他们教会了一个机器人狗集群在没有编舞者的情况下,通过一种“在行动时追求真实,在思考时追求简单”的技巧,在森林中翩翩起舞。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。