想象一下,你正驾驶一辆汽车行驶在一座 GPS 信号完全失效的城市中。也许你身处被高楼大厦包围的深邃“城市峡谷”,或者有人正在干扰卫星信号。汽车的内部计算机(惯性测量单元,IMU)知道你的行驶速度和转向方向,但它有一个致命缺陷:它会随着时间推移而变得混乱。
将 IMU 想象成一个在黑暗房间里闭眼行走的人。他们可以数步数并猜测方向,但几分钟后,他们可能以为自己身在厨房,而实际上却在车库。这被称为漂移。如果没有真实地图或 GPS 信号,他们就会离真实位置越来越远。
TACO 是一个新系统,旨在无需依赖正常工作的 GPS 即可解决这一问题。它将汽车内部传感器与一个巧妙的技巧相结合:从地面仰望天空。
以下是 TACO 的工作原理,分解为简单概念:
1. “智能暂停”(触发机制)
大多数利用卫星图像的导航系统都会尝试每一秒都观测天空。这既缓慢又耗电。TACO 则更加智能。它监听“醉酒”的 IMU。
- 类比:想象 IMU 是一个在黑暗中行走的人,而 TACO 是一个手持手电筒的朋友。朋友不会在每一步都照亮,而是等到行人开始踉跄或偏离路线太远时才打开手电筒。
- 工作原理:TACO 精确计算 IMU 可能产生的误差。一旦潜在误差过大(约 1 米),它就会唤醒相机拍照。
2. “五点猜测”(搜索过程)
当相机被唤醒时,它不会只猜测一个位置。它知道自上次观测以来汽车已经移动了。
- 类比:想象你在拥挤的公园里寻找朋友。你知道他们 10 秒前在喷泉附近,并且知道他们正朝北走。与其只盯着喷泉看,你会查看喷泉、喷泉以北 10 英尺、以南 10 英尺、以东 10 英尺以及以西 10 英尺的位置。
- 工作原理:TACO 会在它认为汽车所在位置周围拍摄五张不同的卫星图像。它将汽车看到的街景与这五张卫星视图进行比对,以找到最佳匹配。这既保持了系统的速度,又确保了准确性。
3. “指南针检查”(守门人)
有时,一条街道看起来像另一条街道(例如由相同房屋组成的网格)。计算机可能会混淆,在你实际偏离 90 度时却声称“你在这里!”。
- 类比:如果你的朋友说“我在公园”,但你的指南针显示你正朝北,而公园在东边,你就知道出了问题。
- 工作原理:TACO 会检查汽车的指南针。如果卫星匹配结果显示的朝向与指南针指示的方向不符,TACO 就会拒绝该猜测。它只接受在几何意义上合理的修正。
4. “置信度评分”(过滤器)
并非所有匹配都是完美的。有些清晰,有些模糊。
- 类比:如果朋友给你指路,当他们非常确定(“我 100% 确定”)时,你比在他们猜测(“我想也许……")时更信任他们。
- 工作原理:TACO 为每个匹配分配一个置信度评分。如果匹配较弱,它只会轻微调整汽车的位置;如果匹配很强,它就会坚定地修正位置。这防止了系统因错误数据而陷入混乱。
结果:为何这很重要
研究人员在真实的驾驶数据(KITTI 数据集)上测试了 TACO,其中 GPS 已被关闭。
- 没有 TACO:汽车的内部导航会剧烈漂移,一段时间后最终偏离真实路径97 米。
- 使用 TACO:汽车保持在轨道上,最终仅偏离16 米。这是6 倍的改进。
- 效率:它仅在约5% 到 10% 的时间内使用相机,其余时间相机处于休眠状态,从而节省电力。
核心结论
TACO 是一个系统,能让机器人或汽车在 GPS 失效的地方(如高楼林立的城市或战区)完美导航。它仅在绝对必要时使用少量卫星图像,以“重置”汽车的内部指南针,防止其永远迷失。它在标准计算机芯片上运行迅速,使其今天即可投入现实世界使用。
技术摘要:TACO – 轨迹对齐跨视角优化
问题陈述
自主移动机器人严重依赖全球导航卫星系统(GNSS)进行绝对定位。然而,在城市峡谷和 contested 空域等关键环境中,GNSS 信号经常受到遮挡、反射或干扰。虽然视觉惯性里程计(VIO)和视觉 SLAM 能够提供高频率的相对运动估计,但它们会随时间累积无界漂移,并且需要预先构建的地图或重访已测绘区域来修正误差。这两种方法均不适合在没有外部通信的情况下,在未测绘地形中执行首次穿越任务。
最近的跨视角地理定位(CVGL)方法已从粗略的瓦片级检索进步到细粒度的度量姿态回归,实现了亚瓦片级精度。然而,这些方法历史上仅被评估为“一次性”定位器(将单张地面图像与单张卫星裁剪图进行匹配),从未被集成到实时连续运行的流程中作为主要的绝对修正手段。挑战在于创建一个无漂移、无需地图的定位器,该定位器仅利用机载传感器(IMU 和单目相机)及单次初始 GNSS 读数即可无限期运行,无需实时外部通信或昂贵的传感器套件。
方法论
TACO(轨迹对齐跨视角优化)提出了一种紧耦合流程,将 IMU 航位推算与细粒度 CVGL 融合。该系统在单个消费级 GPU 上运行,利用单目相机和 IMU,仅在启动时消耗 GNSS 以设置初始 UTM 原点。
核心组件
IMU 预积分与误差建模:
系统维持位置和航向的航位推算估计。一个闭式误差模型跟踪自上次接受修正以来累积的不确定性。它计算横轨误差(由陀螺仪随机游走驱动)和沿轨误差(由加速度计偏置漂移驱动)。该模型生成一个标量触发值 ϵIMU,其随行驶距离和经过时间缩放。
触发与多裁剪搜索:
当估计的 IMU 误差超过阈值(1.0 米)或达到时间限制(2.0 秒)时,触发 CVGL 推理。为了确保查询保持在 CVGL 匹配器的捕获半径内,尽管存在 IMU 漂移,TACO 采用前向偏置搜索:
- 前向偏置: 搜索中心沿当前航向向前移动估计误差的一小部分(δfwd),以考虑自上一个锚点到触发点之间的车辆移动。
- 五点十字: 系统不是进行单次查询,而是围绕偏置中心评估五个候选卫星裁剪图(前、后、左、右和中心)。选择匹配权重最高的候选者。这使得每次触发时的推理成本固定为五次前向传播。
CVGL 模块(FG2):
TACO 利用 FG2,这是一种在卫星瓦片内回归度量姿态的细粒度匹配器。它将地面特征提升到鸟瞰图(BEV)网格,并使用共享的 DINOv2 骨干网络和 Procrustes 对齐与卫星网格进行匹配。输出为二维平移、旋转和一个置信度权重。
偏航残差门控:
在融合 CVGL 修正之前,系统检查航向一致性。由于卫星瓦片已旋转以对齐机载罗盘,网络返回的旋转矩阵编码了残差航向误差。残差超过约 20∘ 的修正将被拒绝,以防止滤波器锁定在对称结构上(例如平行停车位),这些结构会产生高匹配权重但几何姿态不正确。
带各向异性噪声的 UKF 融合:
接受的修正会更新无迹卡尔曼滤波器(UKF)。测量噪声模型是各向异性的,并按匹配权重的倒数进行缩放。这反映了 BEV 匹配器的几何特性,其通常沿航向位置分辨率优于跨航向位置。滤波器仅更新位置状态,保留罗盘导出的航向和 IMU 速度估计。
离线平滑:
因子图(GTSAM)在离线模式下运行以进行后处理。它结合了相同的 IMU 里程计和 CVGL 修正,并辅以经过几何验证的闭环。闭环检测基于空间邻近度、时间间隔以及路径 - 弦比测试,以区分真正的重访与平行路段。
主要贡献
- 首个实时细粒度 CVGL 定位器: TACO 是首个将细粒度 CVGL 用作实时、无限运行时定位器中唯一绝对锚点的系统,用单次启动修正替代了实时 GNSS。
- 误差触发的前向偏置搜索: 一种由 IMU 误差触发的机制结合前向偏置的五点搜索,确保匹配器在固定的低推理成本下在其捕获半径内运行。
- 几何一致性门控: 偏航残差门控和每个修正的各向异性噪声模型确保只有几何一致且经置信度加权的修正才会被纳入状态估计器。
结果
该系统在 KITTI 里程计基准(八个序列)上使用单个消费级 GPU(RTX 3090)进行了评估。
- 精度: 在代表性序列组(含转弯的城市驾驶)中,TACO 将中值绝对轨迹误差(ATE)从 97.0 米(仅 IMU)降低至 16.3 米,实现了 5.9 倍 的降低。在所有代表性序列中,其表现优于其他最小传感器基线(DROID-SLAM、DPVO)。
- 漂移约束: 虽然仅 IMU 的误差随距离呈超线性增长,但 TACO 在多公里轨迹上保持了有界的误差包络(约 30 米)。
- 效率: 系统的 CVGL 占空比仅为 5–10%(相机仅在触发时激活)。每帧融合成本 < 0.1 毫秒,总 GPU 成本为每 100 米 2.0–4.1 GPU 秒,比在每个帧上运行 CVGL 的同类地图辅助定位器低一个数量级。
- 硬件: 该系统在单个 RTX 3090 上实时运行,显存占用约 1.5 GB,表明其具备部署在 Jetson Orin 等嵌入式模块上的可行性。
意义与主张
本文主张,TACO 证明了使用细粒度 CVGL 不仅作为一次性检索工具,而且作为移动地面车辆传感器融合回路中的主要绝对修正信号的可行性。通过将 IMU 航位推算与稀疏的、触发的 CVGL 更新紧密耦合,TACO 仅利用大多数户外自主平台的标准传感器,实现了有界漂移、无需地图且无需 GNSS 的定位。
作者强调,这种方法解决了在未测绘地形中的“首次穿越”问题,无需昂贵的激光雷达、预先构建的地图或持续的外部通信。该系统利用单次启动 GNSS 修正在无限运行时间内保持有界误差的能力,代表了迈向 GNSS 拒止环境下鲁棒自主性的重大一步。本文谦逊地指出,进一步的精度提升受限于底层 CVGL 骨干网络(FG2),而非融合架构本身。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。