← 最新论文
💻 computer science

Variational Deep Unfolding with Mamba-Based Nonlocal Modeling for Underwater Image Enhancement

本文提出了一种用于水下图像增强的变分深度展开网络,该网络将基于去雾的变分公式与用于高效非局部建模的 Mamba 层以及用于实现卓越视觉和定量性能的近端轨迹损失相结合。

原作者: Daniel Torres, Julia Navarro, Catalina Sbert, Joan Duran

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniel Torres, Julia Navarro, Catalina Sbert, Joan Duran

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图拍摄一张美丽的珊瑚礁照片,但水质浑浊、泛着绿光且雾气蒙蒙。色彩看起来褪去了,细节也变得模糊不清。这就是水下成像面临的日常困境。

你分享的这篇论文提出了一种新的“智能过滤器”来修复这些照片。作者并没有仅仅靠猜测来修复图像,而是构建了一个将经典物理学与**现代人工智能(AI)**相结合的系统。以下是他们实现这一目标的原理,通过简单的解释呈现如下:

1. 问题所在:“浑浊水质”的配方

作者首先提出了一个关于水下图像是如何被破坏的已知“配方”。他们认为,一张糟糕的水下照片基本上是由三部分组成的混合物:

  • 真实场景: 你真正想要看到的画面。
  • 霾(Haze): 类似于水下的雾,由光线在微粒上反射引起。
  • 噪声: 随机出现的斑点和颜色失真。

大多数旧方法试图通过单纯提高亮度(就像在暗室里调亮灯光)或者使用基于物理学的复杂数学公式来修复这个问题。问题在于:数学公式过于僵化,而“单纯调亮”的方法往往会让照片看起来很不自然或颜色怪异。

2. 解决方案:一个“智能展开”机器

作者创建了一个名为深度展开网络(Deep Unfolding Network)的新系统。你可以把它想象成一个循序渐进的烹饪课程,而不是一个神奇的微波炉。

  • “展开(Unfolding)”的部分: 想象你有一个描述如何净化水质的复杂数学方程。通常,你会像剥洋葱一样,一层一层地解决这个方程中的每一个步骤。作者将这些特定的步骤转化为了一个个微型的 AI 大脑。
  • “深度学习(Deep Learning)”的部分: 他们没有硬编码每一层如何剥开的规则,而是让 AI 通过观察成千上万张“糟糕照片”及其“完美版本”的对比示例,来学习最佳的剥离方式。
  • 结果: 该系统不仅仅是在猜测;它遵循一个逻辑性的、基于物理学的路径,但在每一步中都利用 AI 来做出决策。

3. 秘密配方

为了让这个系统比以往任何方法都更出色,他们加入了两个特殊的成分:

  • “Mamba”引擎:
    通常,观察全局图像(以了解左边的鱼与右边的岩石之间的关系)的 AI 模型运行速度很慢,且非常消耗计算资源。作者使用了一种名为 Mamba(基于“状态空间模型”)的新技术。

    • 类比: 想象你在读一本书。旧的 AI 模型会读每一个字,检查整页,然后移动到下一行。Mamba 则像是一个超级快速的读者,能够瞬间理解故事的脉络,以及开头是如何与结尾相连的,而不会感到疲劳或需要庞大的记忆库。它让系统能够非常高效地观察水下场景的“大局观”。
  • “非局部(Non-Local)”侦探:
    在水下,一条鱼可能看起来很模糊,但它鳞片的图案可能与远处的一块岩石上的图案完全一致。该系统使用“非局部”约束来寻找整个图像中这些匹配的模式。

    • 类比: 这就像一位侦探,他知道如果嫌疑人的鞋印出现在厨房里,那么他们在客厅里可能也留下了鞋印,即使这两个房间离得很远。这有助于系统锐化边缘并保持细节清晰,即使是在模糊的部分也是如此。
  • “轨迹(Trajectory)”教练:
    在训练 AI 时,他们不仅仅告诉它,“让最终的照片看起来很好”。他们还添加了一个特殊的规则,称为近端轨迹损失(Proximal Trajectory Loss)

    • 类比: 想象在训练一名跑步者。你不仅在比赛结束时检查他们是否获胜,你还会检查他们在比赛中每一步的姿势。这个“教练”确保了 AI 采取的每一个中间步骤都是逻辑性的,并且是在正确的方向上前进,从而防止它为了达到看似完美的终点而采取错误的捷径。

4. 结果:更清晰、更锐利、更快

作者使用标准的水下照片数据集,将他们的系统与许多其他方法(包括旧的基于数学的方法和其他的 AI 模型)进行了对比测试。

  • 视觉质量: 他们的照片看起来最自然。其他方法往往会让水色变成绿色或红色,或者让鱼看起来很模糊。而他们的方法保持了真实的色彩和锐利的边缘。
  • 数据指标: 在技术测试中(衡量清晰度和色彩准确度),他们的方法得分最高。
  • 效率: 由于使用了 “Mamba” 引擎,他们的系统比其他尝试完成同样工作的先进 AI 模型运行得更快,且使用的计算机内存更少。

总结

简而言之,作者构建了一个智能的、循序渐进的水下照片 AI 清洁器。它利用物理学的逻辑来明确“需要修复什么”,同时利用超高效的 AI 引擎(Mamba)来搞清楚“如何修复”。其结果是,水下图像变得更加清晰、色彩更佳,并且比我们以前见过的图像更加真实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →