✨ 要点🔬 技术摘要
海底是一个广袤且在很大程度上仍未被探索的前沿领域,然而,正越来越多地通过在礁石、沙地和碎石上静静滑过的自主航行器进行测绘。这些机器在单次任务中捕捉数万张图像,创建了一个庞大的海床档案。然而,将这些原始照片转化为有用的三维地图却极其困难。海水会扭曲光线,海床往往缺乏鲜明的特征,且生成的数据通常只是缺乏可靠深度信息或相机位置信息的平面图像。由于这些障碍,科学家和工程师难以构建准确的数字世界模型。这一差距至关重要,因为研究人员需要现实的三维环境来训练机器人、测试导航系统并研究海洋生态学,但他们无法轻易收集用于此类模拟所需的特定高质量数据。
为了解决这个问题,一个研究小组开发了一种名为 BenthicFlow 的新系统,它作为一个生成引擎来创造水下景观。该系统并非试图缝合真实照片或依赖僵化的计算机脚本,而是从现有的调查数据中学习海底的视觉模式,进而发明出全新的、看似合理的场景。团队解决的核心挑战在于如何大规模地创建这些场景,而不使其看起来像是由不匹配的瓷砖拼凑而成的补丁被。以往的方法通常生成细小的、独立的局部海床碎片,然后尝试在后期进行拼接,这一过程经常导致明显的接缝和不一致的纹理。BenthicFlow 采取了不同的方法,通过一个连续且统一的过程来生成整个场景。它使用一个单一的数学模型,同时生成彩色图像和深度图,确保沙粒或岩石的纹理从一开始就与其三维形状完美匹配。
该系统的运作方式是提取特定水下位置的少量参考图像,并利用它们来引导更大规模环境的创建。可以将这个过程想象成绘制一幅巨大的壁画,艺术家不断参考几幅小草图,以保持正确的风格和色调。计算机从大面积的静态噪声开始,逐步将其精炼成清晰的图像。为了处理广阔的海底区域,系统将任务分解为重叠的部分,同时处理所有部分并在处理过程中进行融合。这确保了各部分之间的过渡是无缝的,没有硬性的线条或图案断裂。一旦计算机生成了大面积、高分辨率的海底图像及其对应的深度图,它就会将这张平面图片提升为一个完整的三维环境。它通过将每个像素转换为在空间中正确定向的微小平面元素来实现这一点,从而创建一个可以从任何角度观看的连续、可导航的三维世界。
研究人员使用采集自三个不同地点(澳大利亚的两个礁石区和夏威夷的一个沿海水域)的数据对他们的系统进行了测试。他们发现生成的场景与真实环境高度契合,捕捉到了每个地点的特定颜色、纹理和光照条件。与其他先进的图像生成工具相比,BenthicFlow 生成的图像与实际的水下数据更为一致,避免了通用模型经常产生的那些奇异、程式化的珊瑚和清澈蓝水。该系统还证明了其在不同位置之间进行插值的能力,能够平滑地将一个礁石的特征融入另一个,从而创造出多样且连贯的景观。此外,系统生成的深度信息与视觉纹理高度一致,这意味着计算机不仅创造了一张漂亮的图片,还创造了一个结构准确的地形表现。
通过成功生成这些可扩展的水下环境,这项工作为海洋科学和机器人技术提供了一个强大的新工具。创建大规模、现实的三维模拟的能力,使工程师能够在虚拟世界中训练自主航行器,使这些虚拟世界能够紧密模拟现实海洋中的挑战——从浑浊的水质到复杂的地形——而无需事先实地访问每一个地点。它也为生态学家提供了一种模拟健康海床的方式,为检测珊瑚白化或入侵物种等异常情况提供了基准。这项研究表明,通过将图像生成与几何生成统一为一个单一且连续的过程,克服以往方法的局限性,从而创建出既广阔又具有深度真实感的海洋底数字孪生体是完全可能的。
技术摘要:BenthicFlow
问题陈述 水下计算机视觉面临着一个关键瓶颈:尽管自主水下航行器(AUV)已经积累了大量的图像集合,但由于缺乏可靠的相机位姿、稠密 3D 监督,以及结构从运动(SfM)和 SLAM 在低纹理、高浑浊环境下的退化,可用的 3D 结构化数据仍然十分匮乏。现有的弥补这一数据缺口的生成式方法存在显著局限性。先前的方法(如 [52] 中的可扩展地形生成器)通过使用单独的修复模型将独立生成的图块进行拼接来组装大型场景。这种策略会引入边界伪影,无法维持整个场景的全局连贯性,并且将生成限制在单一调查站点,缺乏在地理上不同的环境之间进行插值的能力。此外,通用基础模型无法捕捉调查图像中特有的、通常较为平坦且浑浊的外观,反而倾向于生成风格化的、清澈水域的珊瑚礁。
方法论 作者提出了 BenthicFlow ,这是一个统一的框架,用于生成空间可扩展、对齐的 RGB-深度(RGBD)马赛克,并将其提升为显式的 3D 环境。该流水线由三个主要阶段组成:
潜在表示 (d-RAE): 系统在一个由改进的表示自编码器(d-RAE)管理的压缩潜在空间中运行。该编码器利用冻结的 DINOv2 主干网络处理 RGB 图像,并使用一个从头开始训练的独立 Vision Transformer (ViT) 处理深度图。这些特征被融合为一个单一的潜在表示(z ∈ R h × w × 1024 z \in \mathbb{R}^{h \times w \times 1024} z ∈ R h × w × 1024 ),确保在训练过程中纹理与几何之间的自然对齐。
通过条件流匹配实现可扩展生成:
条件化: 模型以来自特定调查站点的参考图像为条件。从参考种子中提取全局外观描述符,进行均值池化并进行双线性插值,以形成连续的条件网格。这使得模型能够在保留站点特定特征的同时,生成多样化的场景。
流匹配 (Flow Matching): 一个单一的条件流匹配(CFM)模型(实现为全卷积 U-Net)学习回归一个速度场,将各向同性的高斯噪声转换为目标潜在分布。
受 MultiDiffusion 启发的采样: 为了生成大于训练分辨率的场景,潜在画布被划分为重叠的窗口。与先前通过事后拼接图块的方法不同,BenthicFlow 在生成轨迹期间 协调重叠窗口。在每个积分步骤中,重叠标记的预测速度通过可分离的正弦窗权重进行平均。这确保了全局连贯性,而无需二次拼接网络。
3D 提升: 去噪后的潜在画布被解码回高分辨率的 RGBD 马赛克。随后,这个 2.5D 观测结果通过表面对齐的高斯面元 (surface-aligned Gaussian surfels) 被提升为连续的 3D 表示。与各向同性的 3D 高斯不同,面元根据局部表面法线进行定向,并具有各向异性的平面延伸,以防止跨越深度不连续处。一个仅外观的精细化步骤会调整颜色和不透明度,以匹配源视图同时保持几何完整性。
核心贡献
统一的可扩展生成: 一种窗口化流匹配公式,其中重叠的潜在窗口在共享的生成轨迹中进行协调。这使得使用单一生成模型创建空间可扩展的 RGBD 马赛克成为可能,消除了对单独的修复或拼接网络的需求。
跨站点插值: 单一的条件速度场能够跨越多个地理上不同的调查站点,并在它们之间进行平滑插值,这是以往的水下生成器未能展示的能力。
基于面元的 3D 提升: 一个将 RGBD 马赛克转换为空间连续 3D 表示的提升阶段,利用表面对齐的高斯面元,提高了表面覆盖率并保留了估计的几何结构。
结果 实验在来自三个不同地点(Batemans Bay、Scott Reef 和 Hawaii)的 600,000 帧以上的底栖帧上进行。
图像质量: BenthicFlow 显著优于最先进的 FLUX.2-dev 基准,其平均 Fréchet Inception Distance (FID) 为 16.2,而基准为 99.7。它还展示了卓越的条件符合度(余弦相似度为 0.842 对比 0.649)。
站点特定性: 在生成数据上训练的 k-NN 分类器保留了真实数据 95% 以上的平衡准确率和宏平均 F1 分数,证实了站点特定视觉线索的保留。
无缝性: Seam Gradient Ratio (SGR) 指标表明,在 62.5% 的窗口重叠下达到了最佳融合,边界伪影与其余纹理难以区分。
深度一致性: 系统实现了生成图像与深度图之间的近乎完美的对齐(Pearson 相关系数 r = 0.997 r=0.997 r = 0.997 ),验证了多模态生成的结构一致性。
3D 保真度: 针对 3D 提升阶段的消融研究表明,使用带有锚定精细化的表面对齐面元能获得最佳的单视图保真度(SSIM 0.925, LPIPS 0.046),优于各向同性高斯方法。
意义 本文声称 BenthicFlow 通过其统一的公式解决了现有水下生成流水线的局限性。通过将生成和修复视为共享采样轨迹中的单一操作,该框架能够产生连贯的大规模 3D 场景,且不会产生与事后拼接相关的伪影。在地理上不同的站点之间进行插值的能力,为海洋生态学提供了一个常态先验,并为训练自主水下航行器感知系统提供了可扩展的合成地形来源,特别是在无法提前收集目标站点数据的情况下。这项工作为生成真实的、具有复杂拓扑结构的水下环境奠定了基础,而程序化建模和标准扩散流水线一直难以复制此类环境。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。