Reinforcement Learning on Cost-Constrained Quadrupedal Hardware
本文通过采用一个结合了平均延迟前向模型与时间感知神经网络的方法,证明了在低成本四足硬件上部署强化学习可以克服由执行器延迟引起的显著实机迁移差距,并能自主学习一种鲁棒的、受生物启发的中央模式发生器。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图通过一根连接着极长且缠绕在一起的电话线,从一个遥远的房间里对着一只小狗大喊指令来教它走路。等到你的声音传到小狗耳中时,它已经被自己的爪子绊倒了。等到它试图根据你新的喊声来修正步伐时,它又已经摔倒了。这就是“从模拟到现实”(Sim-to-Real)机器人技术的日常挣扎——在这个领域,科学家们试图通过在完美的、即时的视频游戏世界中进行训练来教机器人运动,然后却将它们送入混乱、缓慢且充满噪声的现实世界。
核心问题是“延迟”,即指令与动作之间的延迟。在昂贵的高科技机器人中,这种延迟微乎其微——小到几乎不可见。但在廉价、负担得起的机器人中,延迟可能会非常大,就像等待缓慢的网络连接加载视频一样。当这种延迟变得过大时,机器人无法仅仅根据它现在看到的情况做出反应;它必须去猜测接下来会发生什么。这使得机器人的大脑变成了一个谜题:它必须在不知道自己的腿现在究竟在哪里的情况下,设法学会走路,只能知道它们在刚才那一刻的位置。大问题在于:我们是需要制造昂贵的、超快速的机器人来解决这个问题,还是可以教会一个廉ly的机器人变得足够聪明以应对滞后?
这篇论文讲述了一支决定尝试第二种方案的团队的故事。他们采用了一台非常便宜的、价值300美元的四足机器人 Mini Pupper 2,该机器人的电机存在高达76毫秒的巨大延迟。他们并没有试图修复硬件,也没有试图构建复杂的数学桥梁来预测机器人的位置,而是向自然寻求灵感。他们问道:当动物的神经反应迟钝时,它们是如何走路的?答案在于脊髓,它使用一种特殊的节奏发生器,即使在大脑反应迟缓时也能保持腿部运动。
研究人员训练了不同类型的“大脑”网络(神经网络)来控制这台廉价机器人。他们发现,一个简单的、标准的“大脑”(称为 MLP)表现得极其糟糕,除非他们花费数小时利用一套复杂的规则进行人工调优。然而,一种更先进的、“具备时间感知能力”的大脑(称为 LSTM)却自发地完成了神奇的任务。它学会了忽略来自机器人传感器的嘈ual、延迟信号,转而生成它自己的内部节奏,完全就像脊椎动物脊髓中发现的中央模式发生器(CPGs)一样。
结果令人震惊。这种自学成才的节奏如此强大,以至于当研究人员在现有滞后的基础上人为地又增加了320毫秒的延迟时,机器人仍能保持行走。虽然简单机器人的大脑崩溃并停止了行走,但具备时间感知能力的大脑却保持着稳定的小跑步调。论文指出,这不仅仅是一个幸运的巧合;它是一种通用的策略。当你迫使一个机器人去应对缓慢、多噪的硬件时,它能找到的最聪明的解决方案就是不再试图对现状做出反应,而是开始生成属于自己的未来。
团队还发现,试图使用机器人实际的、带有噪声的传感器数据(如速度和力度)实际上会让情况变得更糟。因为廉价的传感器如此不可靠,所以当团队告诉机器人假装这些传感器不存在,并完全依赖其内部节奏时,它的行走表现反而更好。他们构建了一个两层系统:一个“节奏保持者”(LSTM)负责处理长期计时,以及一个简单的“预测器”(一个小型的神经网络)负责猜测腿部应该在的位置,从而取代了那些损坏的现实世界传感器。
最终,这篇论文证明了你不需要一台价值1万美元的机器人也能走得很好。你只需要一个拥有“懂得等待之脑”的廉价机器人。通过模仿生成内部节奏这一生物学技巧,研究人员缩小了模拟与现实之间的差距,表明有时,应对一个缓慢、嘈杂世界的最好方式,就是停止倾听它,开始跳起属于你自己的舞步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。