Anticipatory Risk-Guided Reinforcement Learning for Safe Flight Through Dynamic Clutter
本文提出了一种前瞻性风险引导的强化学习框架,该框架利用基于最近相遇点(CPA)推导出的自预测、方向一致的碰撞风险图,使四旋翼无人机仅凭机载深度序列即可在动态障碍物中实现安全且高效的导航,并实现了从仿真到现实的稳健零样本迁移。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个微型无人机成为新的送货员、披萨配送员和应急响应人员的新世界。为了完成工作,它们需要穿梭在拥挤的城市、森林和繁忙的街道中,而不撞到人、车或其他的无人机。这就是微型飞行器(MAV)“自主导航”面临的挑战。难点不仅在于现在能看到面前有什么;更在于预测一瞬间之后会发生什么。如果无人机只有在看到有人向它跑来时才做出反应,那就太晚了。它需要成为一个“前瞻性”的思考者,在危险到来之前就预见到它。
传统上,工程师们试图通过给无人机一个能够明确追踪每个物体——将其标记为“人”、“车”或“树”——并计算其速度的“大脑”来解决这个问题。但这就像是在玩杂耍的同时还要解数学题;这太慢了,而且如果无人机视线暂时丢失了某个物体,整个计划就会崩溃。另一种方法是使用“强化学习”,即无人机通过试错来学习,就像电子游戏中的角色一样。然而,标准的视频游戏学习通常依赖于模糊的奖励(比如“做得好”或“你撞车了”),却没能教会无人机为什么某件事是危险的。本文探讨了如何仅通过摄像头,在不需要明确命名或追踪所见物体的条件下,教导无人机去“感知”未来的碰撞风险。
这项研究背后的研究人员——梅于超(Yuchao Mei)及其同事——提出了一种巧妙的新方法,通过一种他们称之为“前瞻性风险引导强化学习”的方法来训练这些飞行机器人。把他们的这种方法想象成教导无人机玩一场高速度的“烫手山芋”游戏,但与其等待音乐停止,不如让无人机在物体靠近之前就能感受到散发出的热量。
在旧的方法中,无人机可能会尝试识别一名移动的行人,计算其速度,然后决定躲避。这很慢,而且如果摄像头画面模糊或物体被遮挡,就很容易出错。作者反对这种“显式追踪”方法,认为在快速、混乱的环境中这种方法过于笨重。相反,他们构建了一个系统,让无人机通过观察一系列深度图像(就像是它面前世界的 3D 电影)来瞬间感知一张“风险图”。这张图不是物体的清单;它是一种压力的感觉,展示了碰撞最可能在何时、何地发生。
为了教会无人机这项技能,研究人员使用了一种“特权”训练方法。想象一下,一名飞行学员正在模拟器中飞行,而教练知道其他所有飞机和障碍物的确切位置和未来轨迹。教练在学员的屏幕上画出一个发光的红色区域,即“最近相遇点”(CPA)——如果情况不改变,碰撞发生的精确位置。随后,学员(无人机的 AI)被训练为仅通过观察景象,就能预测出这个发光的红色区域,而不需要教练每次都告诉它答案。论文使用了一个名为“最近相遇点”的数学概念来创建这张风险图,它结合了障碍物移动的速度以及它与无人机之间的距离。
他们发明的核心是一个“非对称演员-评论家”(asymmetric actor-critic)架构。简单来说,这就像是在训练期间有两个大脑在协同工作。“评论家”大脑可以访问所有的秘密模拟器数据(即教练的视角),并知道真实的风险。而“演员”大脑则是实际操控无人机飞行的部分;它只能看到原始的摄像画面。“评论家”会不断地督促“演员”:“你漏掉了那个红区!你需要学会从左侧预判那份危险!”这迫使“演员”学会纯粹通过视觉模式来预测未来的危险图,而不需要知道物体的名称或速度。
他们在计算机模拟和真实飞行中的测试结果显示,这种方法效果惊人。在充满 20 到 50 个移动和静态障碍物的模拟环境中,新方法在某些场景下的成功率高达 95%,显著优于在处理高密度障碍物时表现挣扎的旧方法。更重要的是,无人机不仅生存了下来,而且飞得更高效。虽然旧方法为了安全往往会悬停或移动得非常缓慢,但这种新无人机在保持超过 2.8 米的平均间距(平均净空距离)的同时,能保持约 3.4 到 4.0 米/秒的平均速度。
或许最令人印象深刻的部分是,无人机在计算机模拟中学到了这些技能,却能在无需任何额外调优的情况下在现实世界中完美飞行。这被称为“零样本模拟到现实迁移”(zero-shot Sim-to-Real transfer)。研究人员驾驶无人机穿过布满树木的森林和堆放着箱子的仓库,甚至当行人突然从转角处跑出来时,无人机也能立即做出反应。它并没有撞上去或原地停死,而是刹车、悬停并平滑地绕行。论文指出,通过教导无人机去预测未来危险的“形状”而非仅仅追踪物体,它变得更加稳健且灵活。
作者谨慎地指出,他们的方法依赖于“障碍物在短时间内以大致恒定的速度移动”这一假设,并且使用的是带有盲区的正前方摄像头。然而,在这些限制范围内,论文证明了赋予无人机一种预判未来风险的“第六感”,能让它在复杂的动态环境中以以往方法无法企及的安全性和速度进行导航。这是迈向未来的一步:在那时,无人机穿梭于我们的忙碌世界中,不再仅仅是遵循规则的机器,而是能够预判意外情况的智能飞行员。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。