Learning Social Robot Navigation By Sensing Human Legs
本文介绍了 CALF,这是一种在定制模拟器中训练的端到端神经架构,用于从低安装位置的 LiDAR 扫描中解析人类腿部运动,从而实现通过零样本真实世界部署成功验证的符合社交规范的机器人导航。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人成为街头新面孔,试图在繁忙的城市人行道上穿行的世界。为了安全移动,机器人需要理解人们在哪里以及他们如何移动。这就是**社交机器人导航(Social Robot Navigation)**领域。你可以把它想象成教机器人如何成为一名优雅的舞伴,而不是一个笨拙的碰撞机器。为了做到这一点,机器人通常使用一种叫做 LiDAR(激光雷达) 的传感器,它就像蝙蝠的声呐一样,发射出无形的激光束来绘制世界地图。大多数机器人的这个传感器都安装在较低的位置,靠近它们的“脚踝”,因为这样既便宜又易于安装。然而,这种低角度产生了一个棘手的问题:机器人无法看到人的全身,它只能看到人的双腿前后摆动。
长期以来,科学家们试图通过将人仅仅视为简单的、漂浮的圆圈或圆盘来解决这个问题。这就像是试图通过只看漂浮的气球而不是舞者的脚步来导航舞池。这在安静的房间里效果尚可,但在拥挤且移动的人群中,这种方法会失效,因为机器人无法理解走路的节奏。它不知道一条腿即将向前摆动,也不知道一只鞋可能会比机器人预期的伸得更远。这篇论文正是在应对这一特定的空白:当机器人只能看到人的腿时,它该如何学习与人共舞?
这项研究的研究人员利用他们构建的一个名为 LegNav 的模拟器,决定不再把人假想为漂浮的圆圈。相反,他们教会了机器人按照其低位传感器所看到的真实世界来看待世界:即两条独立的、移动着的腿。他们为机器人创建了一个新的“大脑”,叫做 CALF(全称是用于腿部特征的卷积注意力机制,Convolutional Attention for Leg Features)。你可以把 CALF 想象成一位观察力极其敏锐的舞蹈教练。它不仅仅是观察人的大致轮廓,而是观察腿部特定的节奏。它使用一种特殊的计算机视觉技术,通过观察一段时间内堆叠的激光扫描数据,注意到腿部如何在站立不动和向前摆动之间交替。
为了训练这个机器人大脑,科学家们不仅向它展示图片,还将它置于一个虚拟视频游戏中,让它通过试错法进行学习,这种方法被称为强化学习(Reinforcement Learning)。在这个游戏中,机器人因为到达目的地而获得分数,如果撞到人或移动得过于颠簸则会失去分数。至关重要的是,他们教会了机器人一条特定的社交规则:“让路(Yielding)”。如果一个人正好走在机器人正前方,机器人必须停下来等待,就像一个礼貌的人类那样。他们甚至为虚拟人物创建了一个特殊的“非打滑步态(Non-Slip Gait)”模型,确保他们的脚不会像在冰面上一样在地面上滑动,而是真正地踩实并摆动,模仿人类真实的行走。这种对足部运动微小细节的关注正是其中的秘诀。
他们的实验结果非常具有启发性。当他们测试这种新型 CALF 机器人与将人视为简单圆圈的旧方法时,两者的差异天差地别。旧的“圆圈”机器人很笨拙;它们经常撞到人或因为无法预测脚落下的位置而卡住。然而,CALF 机器人学会了平稳地导航。在他们的模拟实验中,它大约 95% 的时间都能到达目标点,同时将主动碰撞(即机器人撞到人)保持在极低的 3.3%。它还学会了在必要时停下等待,实现了 32.4% 的“让路得分”,这意味着它知道何时为行人让路。
或许最令人兴奋的部分是,这不仅仅是计算机游戏的胜利。研究人员将他们表现最好的机器人大脑版本直接放入了一个真实的机器人 TurtleBot 4 中,没有进行任何额外的调整。他们将它送入一个有真实的人在周围走动的真实房间。机器人仅通过观察人们的双腿,就成功地在人群中穿行,停下来让行人通过,并安全地绕过他们。这表明,通过关注人类腿部特定的、有节奏的运动,而不是将人视为简单的色块,机器人可以学习成为我们繁忙世界中更安全、更礼貌的伙伴。这篇论文表明,如果你想让机器人陪你行走,你必须教会它去观察你的脚步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。