← 最新论文
💻 computer science

WMS-Net:Wavelet-Mamba Synergistic Network for Joint Semantic Segmentation and Height Estimation of Remote Sensing Images

本文提出了 WMS-Net,一种小波-Mamba 协同网络,该网络利用多级 Haar 小波变换、基于 Mamba 的方向感知模块以及跨任务注意力交互机制,有效地解决了噪声和特征纠缠问题,从而在单幅 RGB 遥感图像的联合语义分割与高度估计任务中实现了最先进的性能。

原作者: Zhijie Li, Jiawei Chang, Changhua Li, Shengjun Xu, Jie Zhang, Yuan Gao

发布于 2026-09-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhijie Li, Jiawei Chang, Changhua Li, Shengjun Xu, Jie Zhang, Yuan Gao

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在遥感领域,卫星和飞机从高空捕捉地球的影像,一张照片中蕴含着两个等待被讲述的不同故事。一个故事是关于事物“是什么”:是一条路、一棵树、一座建筑还是一辆汽车。这被称为语义分割,即一个将图像中的每个像素都标记为特定类别的过程。第二个故事是关于这些事物“有多高”。这是高度估计,它将平面的图像转化为地形的三维地图,揭示出摩天大楼耸立的屋顶或山丘平缓的坡度。几十年来,计算机科学家一直试图分别解决这两个问题,训练不同的算法来识别物体,并使用不同的算法来测量海拔。然而,这两个任务是深度关联的:建筑物的形状有助于定义其高度,而了解屋顶的高度有助于将其与地面区分开来。挑战在于,当计算机试图同时学习这两者时,现实世界图像中的噪声和复杂性往往会导致这两个教学过程互相干扰,从而导致边缘模糊或测量不准确。

西安建筑科技大学的研究团队开发了一种新方法来理清这种关系,创建了一个他们称之为 WMS-Net 的系统。该系统并没有强迫单个算法同时处理两项任务,而是设计了一个将视觉信息拆分为不同细节层级后再进行重新组合的网络。想象一下观察一张照片,并将建筑物的清晰轮廓与天空和地面的平滑宽阔色彩分离开来。研究人员意识到,识别一个物体的工作很大程度上依赖于那些锐利的边缘和精细的纹理,而测量高度的任务则更多地依赖于平滑、连续的形状和整体轮廓。为了利用这种差异,他们的新系统使用了一种称为“小波变换”的数学工具作为过滤器。这个工具将图像数据分离为包含精细细节和边缘的高频分量,以及持有更广泛结构信息的低频分量。

一旦数据被分离,系统就会将高频细节引导至负责识别物体的网络部分,确保建筑物和树木的边缘能够精准绘制。同时,它将低频的平滑信息发送到计算高度的网络部分,使该部分能够在不受嘈切纹理干扰的情况下理解整体形状和海拔。这种分离防止了两个任务相互混淆。然而,仅仅拆分数据是不够的;系统还需要理解物体在整个图像中是如何相互关联的,例如一条长路如何横跨城市,或者一簇树木如何形成连续的树冠。为了实现这一点,研究人员引入了一个基于现代架构(称为 Mamba)的组件。这个部分的系统就像一个远程扫描仪,能够以极低的计算成本连接图像中相距较远的部分,从而高效地模拟场景的全局结构。

拼图的最后一块是一个允许两个独立信息流——即详细的物体标签和平滑的高度图——进行对话的机制。研究人员构建了一个交叉注意力模块,让高度信息引导物体识别,确保建筑物的轮廓与其测量的海拔保持一致,反之亦然。这创造了一个反馈循环,使两个任务可以相互完善,纠正如果它们孤立工作时可能出现的错误。在针对德国魏兴根(Vaihingen)和波茨坦(Potsdam)城市两组主要航空图像数据集进行测试时,这一新系统表现出了优于现有方法的性能。在魏兴根数据集上,该系统在识别物体方面的准确率达到了 83.2%,且高度测量误差率极低。在分辨率更高、规模更大的波茨坦数据集上,它在物体识别方面的准确率达到了 86.8%,并保持了同样低的高度误差率。

结果表明,通过尊重人类和机器对细节与结构的感知差异,并让这些不同的视角进行协作而非竞争,我们可以创造出一种更加可靠的测绘工具。该系统不仅生成一份标签列表或粗略的高度图,它还生成了一个连贯的三维场景理解,其中建筑物的边界与其测量的实际高度完美契合。这种方法为计算机如何同时学习多维世界提供了一个新的框架,将扁平的照片转化为用于城市规划、灾害监测和智慧城市建模的丰富且具有行动价值的数据。该方法的成功不在于让计算机在通用意义上变得更聪明,而在于为它提供了一种更清晰的方式来组织接收到的视觉信息,在要求它理解整体之前,先将噪声与信号、边缘与形状进行分离。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →