RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation
RecoverFly 是一个感知失败的强化学习后训练框架,通过适配 token 级强化学习、重新审视失败案例以及采用带有正则化的课程学习,增强了端到端的无人机视觉-语言导航能力,并在 TravelUAV 基准测试上实现了卓越的性能和泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人驾驶无人机穿梭在一座巨大的三维城市中,去寻找一个特定的物体,比如一个红色的消防栓或一个蓝色的信箱。你不能直接给它一张地图;你必须用直白的英语与它交流,比如“向右飞,然后向上升,寻找那个红色的东西”,同时让它通过摄像头观察世界。这就是无人机**视觉-语言导航(Vision-Language Navigation)**的挑战。这是一场复杂的舞蹈,机器人必须倾听你的指令,观察建筑物和树木,并实时决定如何控制电机进行移动。
传统上,科学家们通过向机器人展示成千上万段专家完美飞行的视频来教导它们。机器人会尝试模仿这些专家,这种方法被称为行为克隆(Behavior Cloning)。但问题在于,如果机器人犯了一个小错误,比如稍微向左偏移了一点,专家视频并不会展示如何修复这个特定的错误。机器人只会不断重复同样的错误,直到撞毁或迷失方向。为了解决这个问题,研究人员使用了强化学习(Reinforcement Learning),这就像玩电子游戏一样,机器人通过靠近目标获得积分,通过撞毁则失去积分。机器人通过尝试、失败、再尝试来学习。然而,标准的“游戏化学习”有一个缺陷:当机器人撞毁时,它往往会立即忘记教训并转向简单的任务,从而浪费了这次撞毁所带来的宝贵经验。
这正是名为 RecoverFly 的一项新研究发挥作用的地方。研究人员在使用名为 TravelUAV 的数据集时意识到,最好的学习方式不仅仅是多飞,而是要记住你的失败。他们构建了一个像严厉而又乐于助人的教练一样的系统。RecoverFly 不会让无人机随机飞行并寄希望于它能学会,而是强制无人机重演那些它撞毁或陷入困境的精确时刻。它会说:“你在这里失败了。让我们再次尝试这个特定部分,但这一次,要学会如何恢复。”通过将这种“失败重放”与一种特殊的训练计划相结合——该计划确保无人机在罕见且困难的地图和物体上进行练习(而不是只在那些经常见到的简单场景中练习)——团队创造出了一台更擅长纠正自身错误的无人机。
结果令人振奋。当他们使用这种新方法与之前的最优模型进行对比测试时,经过 RecoverFly 训练的无人机在寻找目标方面变得显著更好。在从未见过的地图上,成功率提升了约 5.39 个百分点。在遇到从未见过的物体的地图上,成功率提高了 3.12 到 8.37 个百分点。或许最令人印象深刻的是,无人机实现所有这些改进时所使用的总练习量(称为“展开预算/rollout budget”)仅为整个训练数据集大小的约 30%。换句话说,通过从错误中更聪明地学习,而不是仅仅通过增加飞行次数,无人机在无需撞毁数千次的情况下,就能更好地在复杂的现实环境中进行导航。
该论文表明,这种方法解决了一个机器人学习中的重大问题:即忘记困难教训的倾向。通过明确地重新审视未解决的失败,并平衡训练以包含罕见且困难的情景,RecoverFly 帮助无人机实现了技能的泛化。它不仅仅是在记忆路径,而是在学习“当情况出错时如何恢复”这一概念。虽然这项研究是在模拟环境中展示的成果,但作者指出,这一框架可能是让自主无人机能够可靠地在混乱、不可预测的真实环境中进行导航的关键一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。