Joint On-and-Off Policy Learning for Vision-and-Language Navigation
本文介绍了 JOP-VLN,这是一个通过三阶段训练流水线将离策模仿学习与在策探索进行协同整合的新颖框架,旨在视觉语言导航基准测试上实现最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人成为你的私人导游。你想让它听从你的语音指令,比如,“走到厨房,在蓝色花瓶处左转,然后停在冰箱前”,并让它真的做到这一点,而不撞到墙壁或迷路。这就是**视觉-语言导航(Vision-and-Language Navigation, VLN)**的世界。这是机器人学的一个分支,其中一个“具身智能体”(拥有身体和眼睛的机器人)必须通过摄像头理解混乱的现实世界,并通过理解人类语言来进行移动。
这里最大的挑战在于,机器人非常不擅长从自己的错误中学习。如果你通过展示完美的行走视频来教机器人,它会学会模仿这些视频。但一旦它走进一个新房间,或者看到椅子换了一个位置,它就会陷入恐慌,因为它从未学会如何在出错时恢复。这就像一个学生背下了练习题的答案,但当老师改变题目数字时就僵住了。为了解决这个问题,科学家通常尝试两种不同的方法:要么向机器人展示更多完美的路径示例(模仿学习),要么让机器人在周围徘徊,并在它接近目标时给它一个“奖励”(强化学习)。长期以来,这两种方法就像是两个互不往来的独立流派。
JOP-VLN 出现了,这是一个决定为这两个流派举办一场联合派对的新框架。研究人员构建了一个分三个阶段教学的系统,将模仿专家的安全性与自主探索的勇气融合在一起。你可以把它想象成一个训练营:机器人首先向大师教练学习基础知识,然后在一个带有“安全网”的简化版世界中进行练习,当它跌倒时,安全网会接住它;最后,它进入荒野进行探索,但有一个特别的规则:它只关注那些它感到困惑或犯错的时刻,利用这些时刻让自己变得更聪明。
该论文引入了这个三阶段流水线,以解决机器人遇到新事物时卡住的问题。在第一阶段,机器人学习基础导航技能并学习如何总结它所看到的景象,就像学生学习字母表和如何写句子一样。在第二阶段,机器人尝试导航,每当它开始偏离航线时,一个“上帝模式”的安全系统(称为 oracle)就会介入纠正其路径。机器人随后从这些被纠正的路径中学习,有效地练习如何从错误中恢复。这就是“离策”(off-policy)部分,即它通过结合自身尝试和安全网纠正后的数据来进行学习。
魔力发生在第三阶段,论文将一切结合在了一起。研究人员意识到,如果让他们随机探索,机器人可能会只是原地打转或养成错误的习惯。因此,他们添加了一个聪明的过滤器:他们只让机器人在那些真正不确定或“高熵”(一个表示它在乱猜的专业术语)的时刻进行学习。这防止了机器人把时间浪费在它已经掌握的简单任务上,并迫使它专注于难题。此外,他们对训练数据进行了排序,确保机器人把最多的时间花在练习那些它之前失败的具体路径上,从而确保它学会如何修复自己的错误。
这种方法的成果令人印象深刻。在标准导航基准测试中,JOP-VLN 在 R2R 数据集上实现了 69.9% 的成功率,在 RxR 数据集上实现了 68.0% 的成功率。这些数字代表了新的最先进水平(state-of-the-art),意味着它超越了以往仅依赖单一类型学习的方法。研究人员还在现实世界中测试了机器人,使用一只四足机器人狗在室内办公室和室外花园中进行测试。即使面对现实世界中杂乱的光照和纹理,机器人仍能遵循复杂的指令,证明了这种“联合”学习风格比以前能更好地实现泛化。论文指出,通过仔细混合专家指导与智能的、以错误为中心的探索,我们可以构建出不仅擅长遵守规则,而且具备足够的韧性来应对现实世界中意外转折的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。