InFeR: Informed Failure Resilience in Learned Visual Navigation Control
本文提出了 InFeR,这是一个通用框架,通过利用变分信息瓶颈进行分布外失败检测,并结合 Grad-CAM 定位失败源以实现自主恢复,从而增强用于视觉导航的模仿学习策略,且整个过程无需额外的失败或恢复训练数据。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人通过观看人类完美行走的视频来学会在房子里行走。这被称为模仿学习。机器人观看视频,学习模式,并尝试复制它。
然而,存在一个大问题:当机器人遇到从未见过的事物时会发生什么?
也许一只猫突然冲到它面前,或者一扇在训练视频中是开着的门现在关上了,又或者摄像头被黑漆覆盖了。在这些“分布外”(OOD)时刻,标准机器人策略只是盲目猜测。它可能会继续撞向猫,撞上门,或者原地打转,而机器人往往甚至没有意识到自己陷入了困境。
InFeR 是一个旨在解决这一问题的新框架。可以把它理解为赋予机器人一种“第六感”和一套“恢复计划”,而无需向它展示任何关于碰撞或失败的视频。
以下是 InFeR 的工作原理,分解为简单步骤:
1. “压力测试”训练(VIB)
通常,机器人仅在“顺利”的日子里进行训练。InFeR 改变了机器人在训练期间的思维方式。它使用一种称为**变分信息瓶颈(VIB)**的技术。
- 类比:想象你在准备考试。普通学生会死记硬背确切的答案。而使用 InFeR 的学生被教导要深刻理解核心概念,以至于他们能立刻判断出某个问题与所学内容相比是“怪异”还是“荒谬”。
- 工作原理:InFeR 迫使机器人将其视觉信息压缩成非常具体、清晰的思维地图。如果机器人看到奇怪的东西(比如黑屏或突然出现的障碍物),这张思维地图就会“混乱”或不符合模式。机器人会立即意识到:“嘿,这看起来不像训练数据!”
2. “聚光灯”(Grad-CAM)
一旦机器人知道出了问题,它就需要知道哪里出了问题。是一只猫?一堵墙?还是损坏的摄像头?
- 类比:想象机器人正在看一个凌乱的房间。InFeR 不会让它只是说“我很困惑”,而是会在导致困惑的特定物体上投射一道发光的红色聚光灯。
- 工作原理:该系统使用一种名为Grad-CAM的工具来查看机器人的内部“思维”,并高亮显示图像中导致问题的确切部分。如果一把椅子挡住了去路,机器人就会高亮显示这把椅子。如果摄像头被覆盖,它就会高亮显示整个黑屏。
3. “恢复计划”(启发式策略)
现在机器人知道自己陷入了困境,并且知道问题出在哪里,它需要解决它。由于机器人从未看过如何从碰撞中恢复的视频,它无法直接“学会”新技巧。相反,InFeR 为它提供了一套简单而智能的规则。
- 类比:这就像一张“免罪金牌”,附带几个特定的动作:
- 如果聚光灯在左侧:机器人知道要向右转以避开障碍物。
- 如果聚光灯在右侧:机器人向左转。
- 如果机器人被困在角落:它会尝试后退。
- 如果摄像头损坏(黑屏):它知道无法独自解决,于是停止,等待人类帮助。
结果
研究人员在现实世界中使用了一台真实的机器人(波士顿动力公司的 Spot)对此进行了测试。他们没有向机器人展示任何它碰撞的视频,只是用"InFeR"的方式训练了它。
- 测试:他们让机器人在室内和室外行走一段 300 米的路线,并引入了诸如路径受阻、突然移动的障碍物,甚至覆盖摄像头等问题。
- 结果:机器人成功检测到了这些问题,找出了原因,并自行修复。它可以后退、避开障碍物,或者在情况无法解决时请求帮助。它在无需人类接管控制的情况下完成了这段漫长的旅程。
为什么这很重要
大多数以前的方法只能说:“我想我失败了”,然后只是停下来等待人类。InFeR 之所以特殊,是因为它说:“我失败了,我看到了原因(猫在那里),并且我知道该做什么(向左转)。”
它将一个盲目遵循脚本的机器人,转变为一个能够适应、识别危险并自救的机器人,而这一切都不需要额外的灾难训练数据。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。