✨ 要点🔬 技术摘要
想象一架无人机正试图飞越一座巨大的、没有窗户的仓库。它没有 GPS 信号,因此无法向天空寻求方向。相反,它必须通过观察周围的墙壁和柱子来确定自己的位置,就像人类在黑暗房间里观察地标一样。
然而,墙壁并不是每个部分都同样有用。有些地方模糊不清,有些太暗,有些则让人感到困惑。如果无人机试图利用一个令人困惑的点来猜测自己的位置,它可能会迷失方向。
这篇论文介绍了一种全新的“智能飞行员”系统,通过三种巧妙的方式解决了这个问题:
1. “置信度计” (证据学习)
大多数旧系统只是猜测墙上某个点的位置。而这个名为 E-SCRNet 的新系统不仅会进行猜测,还会为它看到的每一个像素都记录一个“置信度计”。
这就像天气预报。标准的预报可能会说:“会下雨。”而这个新系统会说:“会下雨,而且我有 99% 的把握,”或者“可能会下雨,但我只有 20% 的把握,因为云层看起来很奇怪。”
类比: 想象你正试图在雾中阅读一个标牌。如果标牌清晰,你就很有信心;如果标牌模糊,你就会感到不确定。该系统能瞬间计算出摄像机视野中每一个点的这种“模糊程度”(称为熵 )。
2. “智能导航员” (感知觉察轨迹)
一旦无人机知道房间的哪些部分是“清晰的”(低不确定性)以及哪些是“多雾的”(高不确定性),它就不会只是直线飞行。它会主动调整航向。
类比: 想象你正拿着手电筒在黑夜的森林中行走。普通的行者只是向前走。而这架无人机就像一位徒步旅行者,不断转动身体,将手电筒光束照向最清晰、最明显的树木,避开那些看不清任何东西的浓雾区域。
工作原理: 无人机的计算机规划了一条路径,使摄像机始终对着“高置信度”的点。它可能会轻微地扭转或转向,以获得更可靠的墙角视角,从而确保自己永远不会迷失方向。
3. “团队协作” (传感器融合)
“置信度计”(摄像系统)非常聪明,但有点慢,就像一位需要时间解决数学难题的深思熟虑的教授。而无人机的内部陀螺仪(IMU)速度极快,但随着时间的推移会变得有些“醉态”,产生漂移。
类比: 系统将“慢速且细心的教授”与“快速且充满活力的跑步者”结合在一起。“跑步者”(IMU)让无人机移动得平滑且迅速,而“教授”(摄像机)会偶尔介入并纠正道:“实际上,我们在这里,而不是那里”,从而修正任何漂移。
结果: 无人机既拥有了跑步者的速度,又拥有了教授的准确性。
他们证明了什么?
作者在计算机模拟和“硬件在环”设置(即真实无人机在实验室飞行,同时由计算机模拟摄像机视图)中测试了该系统。
结果: 与那些仅仅直线飞行或寻找“任何”特征的方法相比,这种新方法犯错更少。
它将位置误差(无人机偏离实际位置的距离)降低了约 5% 。
它将旋转误差(无人机倾斜或转动错误的程度)大幅降低了 30% 。
总结
这篇论文展示了一种无人机导航系统,它不仅仅是在“看”世界,还在“理解”其视野的可信度。通过不断将摄像机转向房间中最清晰、最可靠的部分,并结合快速的内部传感器,无人机可以在 GPS 失效的地方安全、准确地飞行。
技术摘要:SCREP —— 基于场景坐标回归与证据学习的感知增强型轨迹生成
问题陈述
在 GPS 受限的室内环境中,自主飞行需要能够保持紧密约束的视觉定位误差的轨迹。传统的基于地图的视觉定位方法(如特征匹配 FM 或运动恢复结构 SfM)面临着地图重建计算成本高昂以及在大规模环境中扩展性差的问题。虽然视觉惯性里程计(VIO)提供了一种替代方案,但即使在具备感知意识的引导下,它仍受限于累积漂移。
场景坐标回归(SCR)提出了一种基于学习的替代方案,它能直接从单张图像中预测每个像素的 3D 场景坐标,从而通过透视 n 点(PnP)求解器实现无漂移的绝对位姿估计。然而,SCR 的输出通常包含离群点,且运行频率低、延迟高,并非所有预测的像素都是可靠的。这些特性使得在实时规划和控制中使用 SCR 变得复杂,特别是当规划器必须主动引导相机以最大化定位精度时。
方法论
作者提出了 SCREP ,一种感知增强型轨迹规划器,它将基于证据学习的 SCR 位姿估计器与收敛时域(receding-horizon)轨迹优化器相结合。系统架构由两个主要部分组成:
1. 证据化 SCR 位姿估计 (E-SCRNet)
系统利用通过**深度证据回归(deep evidential regression)**训练的神经网络来预测场景坐标及其相关的确定性。
不确定性量化: 与需要多次前向传播(例如蒙特卡洛 Dropout)的标准贝叶斯神经网络(BNN)不同,证据学习可以在单次前向传播中提供正态逆伽马(NIG)分布的闭式估计,涵盖偶然不确定性(aleatoric uncertainty,数据噪声)和认知不确定性(epistemic uncertainty,模型不确定性)。
熵指标: 网络为每个像素输出一个正态逆伽马(NIG)分布。作者将总不确定性定义为该分布的预测熵(predictive entropy) 。该熵图作为一种统一的度量,用于识别可靠的场景坐标。
状态估计: PnP-RANSAC 模块将场景坐标转换为相机位姿。为了解决 SCR 的延迟和离群点问题,系统使用**固定滞后平滑器(fixed-lag smoother)**将这些低频率的 SCR 估计值与高频率的 IMU 数据进行融合,从而产生高质量、高频率的位姿估计。
2. 感知增强型轨迹优化
规划器以收敛时域的方式运行,通过顺序优化位置和偏航角(yaw)轨迹,在追踪参考路径的同时最大化定位精度。
表示法: 轨迹被参数化为 3 次连续的均匀 B 样条曲线。
优化目标: 成本函数是包括路标点追踪、平滑度和动力学约束在内的各项之加权和。至关重要的是,视场角(FOV)成本 是感知增强型的:
它奖励将具有低熵 (高确定性)的场景坐标保持在相机的视锥体内。
它通过降低权重或将高熵像素从成本计算中移除来惩罚高熵像素。
偏航角自由度与轨迹切线解耦,允许相机在不影响载体路径的前提下,专门朝向信息丰富的视角进行定向。
核心贡献
实时感知增强型规划器: 作者提出了一个收敛时域轨迹规划器,该规划器显式地将 E-SCRNet 的不确定性注入优化过程,从而促进了在 GPS 受限环境下的高精度定位。
熵作为不确定性度量: 本研究通过实验证明,与单独的偶然性和认知性度量相比,预测熵是一种更具信息量且分布更广的不确定性度量,能有效与预测误差相关联。
验证: 该方法通过模拟和硬件在环(HIL)实验得到了验证,显示出优于基准方法的定位性能。
实验结果
系统在 FlightGoggles 模拟器中进行了评估,并通过使用四旋翼的硬件在环(HIL)实验进行了测试。
模拟性能:
与基准方法(前向、原生感知增强型以及基于费雪信息矩阵的方法)相比,所提方法平均降低了至少 4.9% 的平移 RMSE 和 30.8% 的旋转 RMSE 。
具体而言,相对于最强的基准(原生方法),该方法在平均平移误差上实现了具有统计显著性的提升(95% 置信区间为 [0.27, 1.84] cm)。
系统在两个不同环境(stata1 和 stata2 )的八条不同轨迹中均表现出了鲁棒性。
硬件在环 (HIL):
在 HIL 实验中,使用所提规划器的融合位姿估计相比于前向视角基准,将平移 RMSE 从 29.7 cm 降至 22.7 cm,将旋转 RMSE 从 6.0° 降至 2.3°。
计算效率:
全流程(SCR 推理、平滑和优化)的平均运行时间约为 91.3 ms (其中 SCR 为 62.2 ms,平滑为 0.8 ms,优化为 28.3 ms),鉴于各模块的执行周期,这足以满足实时运行需求。
重要性与主张
本文声称是首个利用场景坐标回归(SCR)进行主动感知的工作 。通过利用证据学习,该系统克服了通常与 SCR 相关的延迟和离群点挑战,使其能够应用于实时车载机器人。
作者强调,通过仅使用紧凑的神经网络,其方法可以实现长距离轨迹下的无漂移绝对位姿估计 ,避免了特征匹配地图带来的内存和扩展性问题。虽然目前的工作侧重于 SCR,但作者指出,针对 VIO 和 SfM 规划器的基准测试,以及针对避障和对外观变化鲁棒性的扩展,均留作未来研究方向。其主要贡献在于证明了在利用基于学习的场景坐标回归时,不确定性感知型轨迹生成能显著提高定位精度。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。