← 最新论文
💻 computer science

Robust structure from motion for aerial-ground images via detector-free feature matching and multi-view track refinement

本文提出了一种用于空地图像集成的鲁棒运动恢复结构(Structure from Motion)框架,该框架结合了一个具有全向状态空间模块和四叉树注意力的旋转感知无检测器匹配网络,以及多视图轨迹精化技术,旨在显著提高在剧烈视角和尺度变化下的位姿估计精度和三维重建精度。

原作者: San Jiang, Hui Wang, Xing Zhang, Zhongwen Hu, Zhijun Wang, Ruisheng Wang, Wanshou Jiang, Qingquan Li

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: San Jiang, Hui Wang, Xing Zhang, Zhongwen Hu, Zhijun Wang, Ruisheng Wang, Wanshou Jiang, Qingquan Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

构建精确的三维城市模型就像是在尝试拼凑一个巨大的拼图,而这些碎片来自两个完全不同的世界。一组碎片是从高空俯瞰,注视着屋顶和街道;而另一组则是从地面捕捉,仰望建筑立面和门口。几十年来,测量员一直利用无人机飞越城市,并利用车载摄像头在街道中穿行,希望能将这些视角合并成一个单一且完美的数字孪生体。然而,挑战在于这两个视角在比例、角度和光照方面如此迥异,以至于旨在将它们缝合在一起的计算机程序经常失败。它们难以在天空视角和街道视角中找到相同的砖块或窗户,导致最终的模型出现碎片化或缺失整个部分。由于缺乏一种可靠的方式来连接这些遥远的视角,创建高保真城市模型仍然是一项困难且往往不完整的任务。

为了解决这个问题,研究人员开发了一种新系统,充当这些不匹配图像之间的“通用翻译官”。这种新方法不再依赖于寻找特定、明显的点(如角点或边缘)——因为这些点在从上方观察与从下方观察时,往往会消失或看起来完全不同——而是将整个图像视为一种连续的信息流进行扫描。该团队创建了一个专门的计算机网络,它不需要先寻找关键点。相反,它学会了无论建筑如何旋转或相机距离多远,都能识别其纹理和结构。通过同时向八个不同方向扫描图像,该系统建立了一个即使在建筑看起来颠倒或侧向时也能保持稳定的“心理地图”。这使得它能够找到无人机照片与街景照片之间那些以往软件会完全错过的联系。

一旦系统找到了这些连接,它就面临第二个障碍:如何在数十个甚至数百张图像中保持一致性。在典型的重建过程中,随着相机的移动,建筑上的单个点需要被持续追踪。旧方法经常会丢失这些点,导致三维模型破碎成互不相连的“孤岛”。研究人员引入了一个精炼步骤,其作用类似于质量控制检查员。它会审查不同图像对之间发现的所有连接,并根据系统对每个匹配项的置信度将它们链接在一起。如果一个点在多张图像中被看到,系统会将最可靠的观测结果连接成一条单一且连续的轨迹。这确保了最终的模型不仅仅是零散碎片的集合,而是一个每个部分都锚定在邻近部分的连贯结构。

当使用来自德国、瑞士和中国的真实世界数据进行测试时,这种新方法的成果令人瞩目。当研究人员将他们的系统与当前标准进行比较时,新方法在航空图像与地面图像之间找到了近两倍数量的正确连接。在衡量系统确定相机位置能力的测试中,新方法比之前的顶尖技术提高了近 94% 的准确度。更重要的是,当使用这些连接来构建三维模型时,新系统生成的模型更加完整且精确。它生成的 3D 点数量高达传统方法的十倍,填补了此前丢失的细节。最终的模型不仅密度更高,而且几何精度也更高,误差比现有技术减少了近三分之一。

这项工作表明,通过改变计算机寻找图像相似性的方式,我们可以克服从不同高度观察城市所带来的物理限制。该系统不需要特殊设备或预先存在的地图;它只是学会了无论角度如何,都将城市视为一个统一的整体。通过成功地融合天空与街道,这种方法为创建城市规划者和工程师理解及管理复杂建成环境所需的全面、高精度数字地图提供了一条可靠路径。这项技术证明,即使视角截然不同,实现对场景的共同理解也是可能的,它能将破碎的拼图转化为完整的画面。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →