← 最新论文
💻 computer science

Ergodic Imitation for Adaptive Exploration around Demonstrations

本文提出了一种自适应遍历模仿框架,该框架从检索到的演示中构建目标分布,以生成能够在跟踪与探索之间动态插值的轨迹,从而使机器人能够从训练与部署的不匹配中恢复,并在环境变化或观测误差的情况下完成任务。

原作者: Ziyi Xu, Cem Bilaloglu, Yiming Li, Sylvain Calinon

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyi Xu, Cem Bilaloglu, Yiming Li, Sylvain Calinon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人通过特定的迷宫,方法是给它播放一段人类完美完成该任务的视频。这被称为模仿学习。

通常,机器人会尝试一步步精确地复制人类的路径。但如果你移动了迷宫中的一堵墙会发生什么?机器人为了完美遵循视频,会径直撞向墙壁,陷入困境并失败。因为它只是记住了视频,所以它不知道如何“思考”或调整。

本文提出了一种更聪明的机器人教学方法,称为自适应遍历模仿。以下是其工作原理,使用简单的类比说明:

1. “GPS 与迷雾”类比

将机器人的训练数据(人类视频)想象成一条GPS 路线。

  • 正常模式(跟踪): 当机器人在视频中显示的路径上行走时,它就像一个严格的 GPS。它精确地沿着路线行驶。
  • 问题模式(被困): 如果机器人撞墙或路径改变,GPS 会说:“你偏离了路线!”
  • 解决方案(遍历探索): 机器人不会惊慌或放弃,而是切换到“迷雾模式”。它不再试图严格跟随那条线,而是开始在路线周围的区域进行探索。它会稍微徘徊,寻找绕过障碍物的方法,但总体上仍保持在原始路径附近,以免迷路。

2. 机器人如何知道何时切换

机器人内置了一个“停滞计数器”。

  • 想象视频中的人类有一个虚拟时钟,随着他们的步伐一起走动。
  • 机器人也有自己的时钟。
  • 如果机器人能跟上人类的时钟,它就保持在“严格 GPS 模式”。
  • 如果机器人落后了(因为撞墙或困惑),两个时钟之间的差距变得过大。这会触发切换到“迷雾模式”。机器人意识到:“我卡住了;我需要探索以找到新路径。”

3. “磁性橡皮筋”

本文使用一种数学技巧来创建这种“迷雾模式”。想象原始路径是一根橡皮筋。

  • 跟踪时: 橡皮筋是紧绷的。机器人被强烈地拉向路径中心。
  • 探索时: 橡皮筋变得松弛且有弹性。它允许机器人偏离中心更远,以寻找墙壁上的缺口。
  • 形状: 本文使这根橡皮筋具有“各向异性”,用行话来说,就是它向侧面(绕过墙壁)的拉伸程度大于向前或向后的拉伸。这使机器人在保持大致正确方向的同时,能够侧向避开障碍物。

4. 成功的“热力图”

机器人不只是猜测该去哪里。它会查看所有见过的成功视频,并生成一张热力图。

  • 人类经常行走的区域是“热”的(高概率)。
  • 机器人使用一种特殊的数学工具(称为 MMD),确保在徘徊时能高效地覆盖新区域,而不会只是在原地打转。这就像一只搜救犬,知道人最后被看到的大致区域,但如果直接路径被阻挡,它足够聪明,会在灌木丛周围嗅探。

结果

在测试中,研究人员将机器人放入具有狭窄间隙的迷宫中。

  • 他们将间隙(障碍物)移动到了机器人从未见过的新位置。
  • 旧方法: 机器人会尝试遵循原始视频,撞上新墙壁,100% 失败。
  • 这种新方法: 机器人意识到自己卡住了,松开了“橡皮筋”,在原始路径周围进行探索,找到了新间隙,并成功到达了目标。

简而言之: 本文教会机器人成为“聪明的追随者”。当事情顺利时,它们完美地遵循指令;但如果它们陷入困境,它们知道如何创造性地探索周围的邻近区域以解决问题,同时不忘原始目标。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →