← 最新论文
💻 computer science

Trajectory Learning with Graph Representations for Social Robot Navigation

本文提出了一种用于社交合规机器人导航的模仿学习框架,该框架利用基于图的辅助网络来编码人群交互,并利用轨迹级学习模块来捕捉时间动态,从而在仿真和真实场景中均优于现有的数据驱动基准方法。

原作者: Berke Kartal, Burcu Kilic, Yigit Yildirim, Emre Ugur

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Berke Kartal, Burcu Kilic, Yigit Yildirim, Emre Ugur

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人正试图穿过繁忙的机场或拥挤的仓库。它的目标是从 A 点到达 B 点,且过程中不会撞到任何人,也不会让人们感到不适。这被称为“社交导航”。

问题在于,大多数机器人的行为要么过于僵化(遵循在混乱面前会失效的严格规则),要么过于笨拙(通过试错来学习,导致错误不断堆积)。

这篇论文介绍了一种教导机器人如何礼貌地在人类中行走的新方法。可以将其想象为赋予了机器人两种超能力:“社交雷达”和“时光机”。

1. “社交雷达”:将人群视为一张网

大多数机器人将人视为一系列独立的点:“A 人在这里,B 人在那里。”它们忽略了大局。它们没有意识到,如果 A 人停下来与 B 人交谈,C 人可能就不得不绕过他们。

作者创建了一个名为图特征自动编码器 (GFAE) 的工具。

  • 类比: 想象人群不仅仅是一份名单,而是一张巨大的蜘蛛网。每一个人都是网上的一个节点,而连接他们的隐形线条则是他们的关系(谁正和谁一起走,谁挡住了谁)。
  • 工作原理: 这个工具使用一种特殊的数学方法(图神经网络)来“感知”这张网中的张力。它会特别关注那些距离较近或成组移动的人。机器人不再仅仅看到“10 个人”,而是看到了“三组朋友和两个独自行走的人”。
  • 结果: 机器人得到了关于人群情绪和结构的单一、紧凑的“摘要”,而不是一份杂乱的坐标列表。

2. “时光机”:预测未来

旧的学习方法就像是一个只盯着车头正前方道路的司机。如果他看到一个空隙,他就会开进去。但如果一名行人就在 10 英尺外并正朝着那个空隙走来,机器人直到为时已晚才会意识到这一点。这会导致“误差累积”——一个微小的错误会让下一个错误变得更糟,导致机器人陷入困境或发生碰撞。

作者的第二个工具是一个通过人类演示学习的导航模块。

  • 类比: 机器人不仅仅是模仿人类一步步的动作,它是在观看一段人类行走的视频,并一次性学习整段行走的“完整故事”。它学到了:“当我看到那群人时,即使他们还很远,我现在就应该开始向左转弯。”
  • 工作原理: 机器人不仅预测自己下一步会在哪里,它也会预测周围的人下一步会在哪里。它同时预测人群的未来位置和自身的路径。
  • 结果: 机器人可以做出“预判性”动作。它在碰撞发生之前就侧身避让,就像一位熟练的舞者能够预判舞伴的下一个动作一样。

他们是如何测试的

团队通过两种方式进行了测试:

  1. 在视频游戏中(模拟): 他们构建了一个虚拟仓库,其中包含 160 种不同的场景(行人横穿、人群聊天、不同方向行走的人)。
  2. 在现实世界中: 他们使用了一套在户外录制的真实数据集,其中包含真实的人类和机器人。

结果

当他们将这种新机器人与旧方法进行比较时:

  • 旧机器人(行为克隆): 经常撞到人,或者陷入困境,或者因为反应太慢而耗费很长时间才能导航。
  • 新机器人: 表现得更加平滑。它碰撞人的次数少得多,能更成功地到达目的地,并且其移动方式感觉自然且有礼貌。

核心结论

该论文声称,通过教导机器人理解人群的社交结构(使用“蜘蛛网”雷达)以及预测自身和周围人的未来(使用“时光机”学习),它在人类空间中导航时,会比现有方法更安全、更有礼貌。

作者指出,虽然这在社交机动方面效果很好,但他们并未在包含墙壁或家具等重型障碍物的环境下进行测试,也未在此次特定实验中加入“硬停止”安全制动功能。但就“礼貌地在人群中行走”这一特定任务而言,他们的方法是一次显著的升级。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →