← 最新论文
💻 computer science

LiteKD-Net: Lightweight Knowledge-Distilled Network for Mobile Image Denoising

该论文提出了 LiteKD-Net,这是一种轻量级知识蒸馏网络,它利用物理引导的噪声模拟和基于深度可分离卷积的学生模型,在移动端图像去噪的高质量修复与计算效率之间实现了最佳权衡。

原作者: Zhou Zhiyi

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhou Zhiyi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图用智能手机拍出一张完美的日落照片。你希望天空看起来清晰锐利,色彩鲜艳夺目,但你的手机摄像头与专业相机的巨大镜头相比实在太小了。由于手机传感器如此之小,它很难捕捉到足够的光线,导致照片看起来充满颗粒感或“噪点”,尤其是在黑暗环境下。为了解决这个问题,科学家们使用了被称为“神经网络”的计算机程序,它们就像数字照片编辑器一样,学习如何抹除颗粒感并揭示出干净的图像。然而,这些功能强大的编辑器往往像巨大的、沉重的机器人:它们需要消耗大量的能量和内存来运行,这会耗尽你的手机电池,并让照片处理变得极其缓慢。大问题在于计算机科学的这个领域:我们如何构建一个既足够聪明能清理噪点,又足够轻巧快速,能够快乐地生活在你的口袋里的照片编辑器?

这正是 LiteKD-Net 背后的研究人员试图解决的谜题。他们意识到,虽然我们拥有能够漂亮地清理照片的强大“教师”模型,但它们对于手机来说太重了。他们还注意到,训练这些模型很难,因为很难获得完全相同场景下的“有噪点”和“完美清晰”的照片对来进行训练。因此,他们构建了一个全新的系统,其作用就像一位大师级厨师在培训一名副厨。首先,他们创建了一个特殊的“噪声模拟器”,向清晰的照片中添加真实的颗粒感,包括一种棘手的效应——“像素串扰”(即一个像素的信号意外泄露给相邻像素,就像一个声音在人群中传播一样)。接着,他们拿一个沉重的高性能“教师”网络,教一个微小的、轻量级的“学生”网络如何清理图像。秘诀在哪里?学生不仅通过观察最终的图像来学习,它还通过观察教师的内部思维过程,模仿教师的“特征”,而无需携带教师那沉重的“大脑”。

这项实验的结果对于任何热爱移动摄影的人来说都非常令人振奋。团队发现,他们的新型 LiteKD-Net 模型效率极高。在针对一张 256×256 标准图像进行测试时,该模型仅需 167 万个参数(相比之下,教师模型为 1670 万个,而另一个流行的模型 SwinIR 则有 1146 万个)。在所需的原始计算能力方面,LiteKD-Net 仅使用了 108.28 GigaMACs,这比教师模型的 1.17 TeraMACs 和 SwinIR 的 752.13 GigaMACs 大幅下降。这种效率直接转化为了速度:该模型可以以 11.98 帧每秒 (FPS) 的速度处理图像,这大约是沉重的教师模型(运行速度为 6.72 FPS)的两倍,并且几乎是 SwinIR(2.44 FPS)的五倍。

尽管体积更小、速度更快,但该模型并没有牺牲太多质量。在衡量清理后的图像与原始图像接近程度的测试中,LiteKD-Net 实现了 37.9102 的 PSNR0.8975 的 SSIM。虽然沉重的教师模型得分略高(PSNR 为 38.1400),但“学生”的表现非常接近,这表明“知识蒸馏”技巧奏效了。研究人员还注意到,该模型在名为 MUSIQ 的指标上表现最佳,得分为 44.3044,这表明具有很高的感知视觉质量。然而,作者也谨慎地指出,他们的训练方法存在局限性:因为他们是在已处理过的图像上模拟噪声,而不是在原始相机数据上,所以他们的系统并不能完美模拟真实相机的每一个步骤,例如色彩校正或色调映射。尽管如此,这项研究表明,通过将基于物理特性的噪声模拟器与聪明的教学策略相结合,我们可以让手机拍出更干净、更清晰的照片,而无需在口袋里装进一台超级计算机。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →