← 最新论文
💻 computer science

KLTNet: Learning Sparse Feature Tracking for Robust and Accurate Monocular Visual-Inertial Odometry

该论文提出了 KLTNet,这是一种轻量级的、基于学习的稀疏特征跟踪器,通过结合由粗到精的从稠密到稀疏架构以及各向异性置信度权重,取代了视觉惯性里程计系统中的经典 KLT,从而在挑战性的低纹理或高运动环境中实现鲁棒、准确且实时的状态估计。

原作者: Renbiao Jin, Danping Zou, Wenxian Yu

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Renbiao Jin, Danping Zou, Wenxian Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

要理解机器人或自动驾驶汽车是如何知道自己所处位置的,请想象它在黑暗的房间里闭着眼睛行走,仅凭自身脚步的感觉和对经过墙壁的模糊记忆来辨别方向。这就是视觉惯性里程计(visual-inertial odometry)所面临的挑战,这项技术允许机器仅通过一个摄像头和一个运动传感器来绘制周围环境的地图并追踪其运动。摄像头充当眼睛,不断扫描世界中独特的兴趣点,比如桌角或路面的裂缝。随后,机器尝试在连续图像之间追踪这些点,根据这些点的位移来计算它移动了多远。几十年来,实现这一目标的常用方法是一种被称为 KLT 的方法,它的工作原理就像一双眼睛试图锁定一颗尘埃并逐帧跟随它。这种方法快速且高效,但有一个弱点:如果房间过于单调,或者摄像头移动得太快,那颗尘埃就会消失,导致机器迷失方向,在不知不觉中偏离航线。

上海交通大学的研究人员开发了一种名为 KLTNet 的新系统来解决这个问题。该系统不再只是盯着一个点并寄希望于它保持可见,而是在放大细节之前先进行更广泛的观察。它首先观察整个场景,以获取相机移动的大致概念,就像一个人在专注于特定物体之前,先扫视整个房间以确定方位一样。这种初步的、宏观的观察有助于系统即使在相机快速旋转或墙壁过于平滑、缺乏细节的情况下也能保持追踪。一旦系统对一个点应该在的位置有了大致了解,它就会利用包含原始起点、前一位置和当前位置的小图像块进行精确的微调。通过将原始起点固定作为参考,该系统防止了通常随时间累积的小误差破坏整个计算过程。

团队通过将这个新的追踪器接入机器人和无人机使用的现有导航系统来测试它。他们将其置于各种具有挑战性的环境中进行测试,包括传统系统经常失效的长距离、白墙空旷走廊,以及涉及快速、颠簸运动的序列。在这些测试中,新系统始终优于旧方法。在用于衡量机器人导航的标准基准测试中,这种新方法在一组测试中将总距离误差减少了 34%,在另一组测试中减少了 49%。或许最重要的一点是,该系统在纹理稀疏的走廊中保持了稳定性(而旧方法在此类环境下会发生显著漂移),同时在较简单的条件下表现得与旧方法一样出色。研究人员还教会了系统为它追踪的每个点分配一个置信度分数,使机器人能够信任那些看起来清晰的点,并忽略那些模糊或令人困惑的点。这种额外的判断层帮助机器人对其自身位置做出更好的决策。

这项工作的成功在于它能够将简单追踪的速度与更复杂的计算机视觉技术的鲁棒性结合起来,同时运行速度之快足以用于小型电池驱动设备。研究人员证明,他们的系统可以在只有一本小书大小的嵌入式计算机上实时运行,这证明了它不需要庞大且耗电的服务器即可运行。通过用这种新的混合方法取代旧的、脆弱的追踪方法,他们为机器提供了一种更可靠的观察世界的方式,确保机器能够在我们物理环境中的杂乱空间和空旷空间中都能找到自己的路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →