✨ 要点🔬 技术摘要
想象一下,你手持相机走过一个房间,试图仅凭拍摄的照片来确定自己确切的位置和朝向。这就是**视觉里程计(VO)**的工作。这就像蒙着眼走迷宫,但你可以每秒瞥见一张照片,以此推测下一步该往哪走。
长期以来,实现这一目标的最佳方法是“混合”方案:一个智能计算机程序先推测路径,随后一个笨重、缓慢的机械过程(称为优化 )会对推测进行复核和修正。这种方法虽然准确,却如同给赛车拉上手刹驾驶——既慢又笨拙。
现在出现了FVO(快速视觉里程计) ,这是本文介绍的一种新方法,它更像一名短跑运动员,而非背着沉重背包的马拉松步行者。
旧方法的弊端
将旧的混合方法想象成一支建筑师团队:他们先搭建建筑模型,然后雇佣一支工程师团队花费数小时检查每一块砖是否笔直。
尺度问题 :单目(单摄像头)系统存在一个棘手缺陷:它们无法分辨你是在经过一辆玩具车还是一辆真车。若无额外辅助,它们无法判断物体的绝对 尺寸。旧方法常在此处陷入困境,无法确定真实距离。
速度瓶颈 :“工程师”(即优化步骤)耗时过长。等他们完成路径复核时,相机早已移动到了别处。
FVO 解决方案:一种“超直觉”翻译器
作者提议用Transformer 取代缓慢的“工程师”。Transformer 是一种人工智能,以其擅长理解语言和模式而闻名。
1. “直接翻译”类比 FVO 不像旧方法那样先构建 3D 模型再加以检查,而是充当一名超直觉的翻译器。你向它展示一系列照片,它立刻就能说:“好的,根据背景的移动方式,你向左转并走了两步。”
它跳过了中间环节。它不试图先重建整个房间,而是直接从图像中预测运动。
由于它是直接从数据中学习,因此能自行推算出“尺度”(每一步有多大),无需被告知相机参数或依赖预先制作的地图。
2. “置信度评分”技巧 巧妙之处在于:FVO 不仅进行猜测,还会评估自己对猜测的把握程度。
类比 :想象一群朋友试图猜测赛跑的获胜者。有些人非常自信,而另一些人则在胡乱猜测。
FVO 如何运作 :它为其做出的每一个猜测分配一个“置信度评分”。如果它不确定(低置信度),它就将该猜测视为耳语;如果它非常确定(高置信度),则将其视为呐喊。
推理模块 :当系统需要构建最终路径时,它会听取“呐喊”而忽略“耳语”。它将许多重叠的猜测(如同从略微不同的角度观察同一个街角)进行综合,并根据 AI 的置信度进行加权平均。这能自动过滤掉“错误猜测”(异常值)。
为何它是颠覆性变革
论文声称,FVO 的速度比现有最快的方法快近一倍 。
无需手刹 :它不需要缓慢的“优化”步骤来修正工作成果,而是直接一气呵成。
无需特殊工具 :它无需知晓相机的技术参数(标定),也无需第二个摄像头(立体视觉)。它仅需一个标准摄像头即可工作。
“零样本”天赋 :作者在 FVO 从未见过的数据集(TUM)上对其进行了测试。即使未针对这些特定视频进行训练,它依然表现良好,这表明它学到了通用的运动规律,而非仅仅死记硬背特定的房间。
总结
FVO 就像是从一名每 10 秒就要停下来查阅纸质地图并询问路线的导航员,升级为能即时知晓路线并实时调整交通状况的 GPS。它利用强大的 AI 大脑(Transformer)观看视频、推测路径、评估自身置信度,并瞬间将所有信息整合在一起——使其速度足以满足机器人或增强现实等实时应用的需求,且无需昂贵的硬件或缓慢的处理步骤。
技术摘要:基于 Transformer 的快速视觉里程计(FVO)
问题陈述 视觉里程计(VO)旨在从视频序列中估计相机的轨迹。虽然结合深度学习与经典优化(如光束法平差)的混合流水线已实现高精度,但它们存在显著局限性。这些方法通常依赖大规模、预训练且被冻结的 3D 骨干网络,这些网络具有尺度模糊性,继承了无法估计绝对尺度的缺陷。此外,对光束法平差和特征匹配等后处理步骤的依赖造成了推理速度的瓶颈,并且需要已知相机标定参数,而这些参数在现实部署中往往不可用。纯端到端方法虽然更快,但在准确性和鲁棒性方面历来表现滞后。挑战在于开发一种单目 VO 系统,该系统需具备快速、可扩展的特性,无需相机内参或测试时优化,且能在无需繁重后处理的情况下准确估计度量尺度。
方法论 作者提出了快速视觉里程计(FVO) ,这是一个直接相对位姿回归框架,用基于 Transformer 的架构取代了传统的后处理步骤。
架构 :FVO 的核心是一个专为端到端结构化预测设计的 Transformer 模型。它利用一个冻结的、预训练的图像编码器(基于 DUSt3R 框架内的 CroCo 架构)从输入帧中提取视觉特征。这些特征由一个包含 L L L 个重复块的时间 - 空间解码器进行处理。
时间 - 空间注意力 :解码器采用分解的注意力机制。首先,时间注意力 聚合同一空间位置跨帧的信息。随后,空间注意力 允许帧内不同空间位置之间进行信息交互。
相机嵌入 :引入了可学习的相机嵌入,专门用于聚合位姿估计所需的信息。关键在于,这些嵌入仅集成在空间注意力层中,因为将其注入时间注意力层被发现会降低性能。
相对位姿回归 :该模型直接预测连续帧之间的相对相机变换($SE(3)$)。输出包括旋转矩阵、平移向量以及两者的置信度标量。
旋转处理 :为确保有效的旋转,原始预测的旋转矩阵通过特殊正交 Procrustes 问题投影到 $SO(3)$ 流形上。
不确定性感知学习 :FVO 不采用逐像素的置信度标签,而是采用异方差不确定性公式。网络以自监督方式学习预测旋转和平移的置信度分数(c R , c t c_R, c_t c R , c t )。损失函数惩罚过度自信的低精度预测,并降低不确定残差的权重,从而使模型能够在没有显式标签的情况下学习置信度。
推理模块 :为解决单目 VO 中的误差累积问题,FVO 利用重叠窗口方案。输入视频被分解为重叠窗口,模型预测每个窗口的相对位姿。一个置信度感知的推理模块聚合这些重叠预测。预测结果根据其学习到的置信度分数(通过 softmax 归一化转换为权重)进行加权并取平均。旋转在 $SO(3)$ 上使用加权 Fréchet 均值进行平均,而平移则进行线性平均。该过程减轻了异常值的影响,并在无需全局优化的情况下生成平滑、全局一致的轨迹。
主要贡献
FVO 流水线 :一个高效的端到端单目视觉里程计流水线,在多个基准测试中实现了具有竞争力的性能,同时运行速度比最快的基线快近 2 × 2\times 2 × 。
基于 Transformer 的直接回归 :一种新颖的网络架构,直接从图像序列中预测相对相机位姿和置信度估计。置信度是自监督学习的,仅需位姿标注。
置信度感知推理 :一个鲁棒的轨迹恢复模块,利用学习到的置信度权重聚合重叠的位姿预测,有效消除了虚假预测,且无需光束法平差或相机标定。
实验结果 该方法在多样化的室内和室外数据集上进行了评估,包括 ARKitScenes、ScanNet、KITTI 和 TUM_RGBD(零样本)。
准确性 :FVO 在绝对平移误差(ATE)(包括对齐和未对齐)方面实现了最先进或具有竞争力的性能。值得注意的是,它在未对齐指标上优于大规模 3D 模型(如 VGGT 和 CUT3R)以及基于优化的方法(如 DPVO),展示了卓越的尺度估计能力。
速度 :在商用硬件(NVIDIA RTX 3090)上,FVO 的运行速度比现有基线快近 2 × 2\times 2 × 。这种效率归功于消除了昂贵的后处理步骤以及精简的 Transformer 架构。
扩展性 :消融研究证实,该模型随着训练数据的增加(例如,在 ScanNet 基础上增加 ARKitScenes)和模型容量的增加(更多的解码器层)均能稳健扩展。
设计选择 :实验验证了特定的时间 - 空间注意力机制(在空间层中包含相机令牌)、旋转的 $SO(3)$ 投影以及异方差不确定性损失对性能至关重要。
意义与主张 该论文主张,FVO 代表了重大进步,证明了当与充足数据结合时,精简的端到端架构可以取代复杂的混合流水线。通过消除对测试时优化、相机内参和手工设计组件的需求,FVO 使得在那些传统方法失效或速度过慢的场景中实现实时、大规模部署成为可能。作者强调,他们的方法成功利用多样化数据,直接从视觉线索中解决单目尺度模糊问题,为自动驾驶和机器人等实际应用中的实时视觉里程计提供了一条稳健的途径。然而,他们谦逊地指出,该模型主要在静态环境中训练,在高度动态的环境中可能面临局限性,建议未来在数据策展和模型扩展方面开展工作。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。