← 最新论文
💻 computer science

Real-Time Underwater Image Enhancement via Frequency-Guided Dual-Path Attention

本文提出了一种轻量级、实时的水下图像增强框架,该框架通过集成频率引导的双路径注意力机制与具有固定离散余弦变换(DCT)先验的可重参数化卷积,以极低的计算成本和极高的推理速度实现了最先进的性能。

原作者: Leshen Zhang, Ao Li, Ce Zhu

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Leshen Zhang, Ao Li, Ce Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正试图在水下拍摄一张照片。那感觉就像是透过一层厚厚的、青绿色的浓雾在观察。光线被吸收了,色彩变得暗淡,物体的边缘看起来也模糊不清。对于需要通过“看”清水下环境来进行导航或寻找目标的机器人或摄像机来说,这是一个巨大的难题。

这篇论文介绍了一种全新的、超快速的计算机程序,旨在清理这些模糊的水下照片。作者们称之为“实时水下图像增强”(Real-Time Underwater Image Enhancement)系统。你可以把它想象成一个神奇的照片编辑器,它运行速度极快,可以在小型机器人的大脑中直接运行,而不会造成卡顿。

以下是他们是如何实现的,使用了简单的类比:

问题所在:“沉重型”与“轻量型”

通常情况下,要修复一张模糊的照片,你需要一个非常沉重、复杂的计算机大脑(大型 AI 模型)。但这些沉重的大脑对于小型机器人来说太慢了,而且太耗电。
另一方面,也有一些“超轻量级”的模型,它们虽然快速且体积小,但却像是一个戴着眼罩试图修理画作的人。它们只能观察图片的颜色和形状(“空间”视角),却忽略了频率(隐藏的细节和色彩波纹模式)。因为水下的问题本质上都与光波如何被干扰有关,如果忽略了“频率”,修复效果就不会完美。

解决方案:双重超能力

作者构建了一个微小且快速的模型,让它能同时“看到”图片本身和隐藏的波纹。他们通过两个主要的技巧实现了这一点:

1. “预加载”过滤器 (MBRConv-DCT)
想象一下你正在教一个学生画画。与其让他们去猜测如何画一条直线或一条斜线,不如给他们一套预先画好的模板(模板/描图纸),让他们进行描摹。

  • 工作原理: 该模型有一个特殊的“训练模式”,在这个模式下,它使用固定的、预制的数学模式(称为 DCT 核),这些模式充当了水平、垂直和对角线的模板。这些模板帮助模型理解水下图像是如何变得模糊的。
  • 神奇的魔术: 一旦学生(模型)通过这些模板学会了知识,模板就会被移除!模型将这些模板的知识直接融入到了自己的大脑中。因此,当它实际处理照片(推理)时,不再需要这些模板。它运行起来和普通的模型一样快,但它已经具备了识别这些模式的“聪明才智”。

2. “双路径”侦探 (FGDPA)
想象一位侦探正在侦破案件。一位侦探观察物理证据(照片的颜色和形状),而第二位侦探则观察场景的“氛围”或整体能量(频率)。

  • 工作多少: 这个模块拥有两条路径。
    • 路径 A(空间): 正常地观察图片以寻找重要的细节。
    • 路径 B(频率): 利用一种数学工具(FFT)对图片的“声波”进行一次微小且快速的快照,以观察颜色和边缘是如何在全球范围内分布的。这就像是通过听房间里的嗡嗡声来判断是否正在举行派对,而不是去观察每一个人的情况。
  • 结果: 这两位侦探会进行交流。“频率侦探”会告诉“空间侦探”:“嘿,整张图片太绿了,我们得修一下,”或者“边缘太弱了,我们需要把它们锐化。”这个过程非常快,因为频率检查是在一个微小的、固定大小的网格上进行的,而不是针对整个巨大的图像。

结果:快速且清晰

作者测试了他们的创造物,发现:

  • 它很小: 整个模型的规模非常小(仅约 4,200 个“参数”,这就像与其他拥有数百万参数的模型相比,拥有一个非常小的词汇量)。
  • 它很快: 在一台高性能计算机上,它每秒可以处理超过 600 张照片;在小型嵌入式机器人芯片(如 Jetson AGX Orin)上,每秒可以处理超过 100 张照片。
  • 它很有效: 当他们将该模型与其他方法进行对比时,发现即使是面对比它大得多的、更沉重的模型,该模型也能产生更清晰、色彩更丰富且更锐利的图像。它比竞争对手更好地修复了“绿色浓雾”并恢复了细节。

总结

简而言之,作者将一个微小、快速的 AI 模型进行了升级,教会了它去关注水下图像的“隐藏波纹”。他们通过提供在学习后会自动消失的特殊训练工具,以及添加一个快速的“频率检查”来辅助修复颜色和细节。其结果是一个既足够小到可以由机器人携带,又足够聪明到能在深蓝之中看清世界的照片清理器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →