想象一下,一个机器人正试图穿过繁忙的机场或拥挤的仓库。它的目标是从 A 点到达 B 点,且过程中不会撞到任何人,也不会让人们感到不适。这被称为“社交导航”。
问题在于,大多数机器人的行为要么过于僵化(遵循在混乱面前会失效的严格规则),要么过于笨拙(通过试错来学习,导致错误不断堆积)。
这篇论文介绍了一种教导机器人如何礼貌地在人类中行走的新方法。可以将其想象为赋予了机器人两种超能力:“社交雷达”和“时光机”。
1. “社交雷达”:将人群视为一张网
大多数机器人将人视为一系列独立的点:“A 人在这里,B 人在那里。”它们忽略了大局。它们没有意识到,如果 A 人停下来与 B 人交谈,C 人可能就不得不绕过他们。
作者创建了一个名为图特征自动编码器 (GFAE) 的工具。
- 类比: 想象人群不仅仅是一份名单,而是一张巨大的蜘蛛网。每一个人都是网上的一个节点,而连接他们的隐形线条则是他们的关系(谁正和谁一起走,谁挡住了谁)。
- 工作原理: 这个工具使用一种特殊的数学方法(图神经网络)来“感知”这张网中的张力。它会特别关注那些距离较近或成组移动的人。机器人不再仅仅看到“10 个人”,而是看到了“三组朋友和两个独自行走的人”。
- 结果: 机器人得到了关于人群情绪和结构的单一、紧凑的“摘要”,而不是一份杂乱的坐标列表。
2. “时光机”:预测未来
旧的学习方法就像是一个只盯着车头正前方道路的司机。如果他看到一个空隙,他就会开进去。但如果一名行人就在 10 英尺外并正朝着那个空隙走来,机器人直到为时已晚才会意识到这一点。这会导致“误差累积”——一个微小的错误会让下一个错误变得更糟,导致机器人陷入困境或发生碰撞。
作者的第二个工具是一个通过人类演示学习的导航模块。
- 类比: 机器人不仅仅是模仿人类一步步的动作,它是在观看一段人类行走的视频,并一次性学习整段行走的“完整故事”。它学到了:“当我看到那群人时,即使他们还很远,我现在就应该开始向左转弯。”
- 工作原理: 机器人不仅预测自己下一步会在哪里,它也会预测周围的人下一步会在哪里。它同时预测人群的未来位置和自身的路径。
- 结果: 机器人可以做出“预判性”动作。它在碰撞发生之前就侧身避让,就像一位熟练的舞者能够预判舞伴的下一个动作一样。
他们是如何测试的
团队通过两种方式进行了测试:
- 在视频游戏中(模拟): 他们构建了一个虚拟仓库,其中包含 160 种不同的场景(行人横穿、人群聊天、不同方向行走的人)。
- 在现实世界中: 他们使用了一套在户外录制的真实数据集,其中包含真实的人类和机器人。
结果
当他们将这种新机器人与旧方法进行比较时:
- 旧机器人(行为克隆): 经常撞到人,或者陷入困境,或者因为反应太慢而耗费很长时间才能导航。
- 新机器人: 表现得更加平滑。它碰撞人的次数少得多,能更成功地到达目的地,并且其移动方式感觉自然且有礼貌。
核心结论
该论文声称,通过教导机器人理解人群的社交结构(使用“蜘蛛网”雷达)以及预测自身和周围人的未来(使用“时光机”学习),它在人类空间中导航时,会比现有方法更安全、更有礼貌。
作者指出,虽然这在社交机动方面效果很好,但他们并未在包含墙壁或家具等重型障碍物的环境下进行测试,也未在此次特定实验中加入“硬停止”安全制动功能。但就“礼貌地在人群中行走”这一特定任务而言,他们的方法是一次显著的升级。
技术摘要:基于图表示的轨迹学习用于社交机器人导航
问题陈述
在人口密集的环境中,自主移动机器人必须在导航的同时尽量减少对行人的干扰。虽然捕捉社交交互并结合行人运动估计对于实现符合社交规范的行为至关重要,但现有方法面临着显著的局限性:
- 强化学习 (RL): 需要手工设计的奖励函数,这些函数往往将复杂的社交行为简化为静态标准,限制了重现真实世界行人模式的能力。
- 模仿学习 (行为克隆 - BC): 虽然可以直接从真实世界数据中进行训练,但由于采用单步决策,存在误差累积的问题。训练与测试之间的微小分布偏移会导致复合误差。
- 状态表示: 许多方法依赖于固定数量的行人或独立的成对交互,无法建模人群中的关系结构和动态社交交互。
- 预见性: 仅基于当前或过去观测进行导航会限制机器人预测行人意图的能力,导致其只能进行反应式而非预判式的机动。
方法论
作者提出了一个两阶段模仿学习框架,将人群表示学习与导航策略学习解耦。
1. 图特征自动编码器 (GFAE)
为了解决建模社交结构的局限性,作者引入了一个新的辅助网络——图特征自动编码器 (GFAE)。
- 架构: 它使用图 Transformer 层 (GTL) 作为编码器。该层利用多头注意力机制,根据代理(行人与机器人)之间的接近程度和影响力动态地加权交互,而不是平等对待所有交互。
- 功能: GFAE 处理一个图状态,其中节点代表代理,边代表交互。它通过最大池化 (max pooling) 聚合节点嵌入,生成固定大小的人群嵌入 (z)。
- 训练目标: 为了确保池化后的嵌入保留每个节点的信息,网络包含一个解码器,用于从全局嵌入中重建单个节点特征。模型通过最小化原始特征与重建特征之间的均方误差 (MSE) 进行训练。
- 结果: 这产生了可迁移的人群嵌入,能够捕捉独立于下游导航任务的人-人及人-机器人交互。
2. 条件机器人轨迹生成(导航模块)
导航模块基于条件神经运动基元 (CNMP) 框架构建,以解决误差累积和缺乏预见性的问题。
- 输入: 该模块接收一个来自采样观测的共享潜变量表示 (r),这些观测包括时间、机器人位置、目标以及由 GFAE 生成的图嵌入。
- 双头预测: 与标准的 BC 不同,该模块采用两个从同一潜向量运行的解码器头:
- 轨迹头: 预测机器人的未来位置。
- 状态头: 预测未来的 crowd 嵌入(行人运动估计)。
- 训练目标: 网络通过轨迹级学习目标进行训练。它从演示数据中均匀采样观测和目标时间步,并最小化以下各项的线性组合:
- 轨迹损失(高斯负对数似然)。
- 状态预测损失(预测的未来 crowd 嵌入与实际值之间的 MSE)。
- 机制: 通过共同预测机器人的轨迹和未来的 crowd 状态,共享编码器被正则化以编码关于机器人路径和行人动态的信息。这使得机器人能够将预期的行人运动纳入决策过程,从而减轻了单步 BC 典型的误差累积问题。
核心贡献
- 时空框架: 将学习到的空间人群表示(通过 GNN)与时间轨迹学习相结合。
- 图特征自动编码器 (GFAE): 一种通过利用注意力机制来建模人-人及人-机器人交互,从而将人群社交结构编码为固定大小嵌入的新方法。
- 轨迹级导航模块: 一个通过轨迹级目标进行训练的导航模块,旨在减轻误差累积。它通过共享的潜变量表示共同预测行人运动估计和机器人轨迹,从而实现预判式机动。
实验结果
该框架在模拟仓库环境 (SEAN 2.0) 和真实世界数据集 (SCAND) 上进行了评估。
模拟结果 (SEAN 2.0)
- 指标: 通过亲密区侵入计数 (IZIC)、个人区侵入计数 (PZIC)、最小行人距离 (MDTP)、碰撞、导航时间和成功率进行评估。
- 性能: 提出的方法 (GE+CNMP) 在表现上优于行为克隆 (BC)、扩散策略 (Diffusion Policy) 以及使用图嵌入结合 BC 的基准方法 (GE+BC)。
- 它实现了最高的成功率 (98.12%) 和最低的侵入计数。
- 它显著优于扩散策略,作者将其归因于扩散方法缺乏轨迹级目标以及数据集规模较小。
- 消融实验: 证实了使用学习到的图嵌入 (GE+BC) 比原始状态表示 (BC) 能显著提高性能。TransformerConv 层配合最大池化在 GFAE 中取得了最佳的重建损失。
- 可视化: t-SNE 可视化显示,GFAE 潜空间成功地按社交场景对状态进行了聚类,而原始状态空间则不然。
真实世界结果 (SCAND 数据集)
- 设置: 在户外环境的噪声真实世界 LiDAR 数据上进行测试。
- 性能: GE+CNMP 显著优于 BC,成功率达到 98.33%,而 BC 仅为 53.33%。
- 观察: BC 经常因过度冲向目标或与行人碰撞而失败,而所提方法能有效保持社交合规性并到达目标。
重要性与主张
论文声称其框架成功解决了以往社交导航方法的三个主要局限性:
- 误差累积: 通过使用轨迹级学习目标而非单步模仿,该方法减少了执行过程中的误差复合。
- 预期运动: 通过在机器人轨迹的同时共同预测未来的 crowd 状态,系统能够实现灵活的预判式机动,而非仅仅是反应式机动。
- 社交结构建模: GFAE 捕捉了人群的关系结构(人-人交互),而不是将行人视为独立的实体或固定集合。
作者得出结论,其方法在模拟和真实世界设置中均表现出符合社交规范的机动行为,证明了学习传感器运动数据与 crowd 嵌入之间的时序关系比常见的反应式方法具有更优越的社交表现。
局限性
作者承认存在特定的局限性:
- 可扩展性: 用于创建图嵌入的池化操作在高度拥挤的场景下可能会面临可扩展性挑战。
- 碰撞规避: 该框架没有集成显式的碰撞规避保证;实验是在没有静态障碍物的环境中进行的,以专注于社交机动。未来的工作计划将此框架集成到导航栈中,由底层控制器处理碰撞规避。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。