← 最新论文
💻 computer science

Bend the Basics: Degradation-Aware Deformable Tokenization for All-in-One Image Restoration

本文提出了灵活图像 Transformer(Flexible Image Transformer, FIT),这是一种统一的图像修复模型,通过通过自适应补丁变形和一种新颖的任务标记丢弃策略,在整个标记化流水线中显式地集成退化感知,从而增强了在多样且空间非均匀退化下的性能。

原作者: Zihao He, Yunfeng Wu, Xinchao Wang, Songhua Liu

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Zihao He, Yunfeng Wu, Xinchao Wang, Songhua Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图收拾一个凌乱的房间,但这个混乱并不在所有地方都一样。在一个角落里,有一堆湿漉漉、沾满泥泞的衣服;在另一个角落,有一个破碎的窗户;在第三个角落,有一层厚厚的灰尘。如果你有一个使用完全相同的清扫模式进行工作的机器人清洁器,它很可能会漏掉泥泞,撞碎玻璃,或者只是把灰尘到处推来推去。这就是“图像修复”(image restoration)的日常挣扎——这是计算机科学的一个分支,致力于修复被雨、雾、模糊或黑暗破坏的照片。多年来,用于这项工作的最聪明工具就像那个僵化的机器人:它们将图像切成微小的、固定大小的正方形块(就像一格格的便利贴)来进行分析。然后,它们尝试独立修复每一个块。但是,当一道雨痕横跨两个块的边界时,机器人就会感到困惑。它试图修复位于一个块顶部的雨滴和位于另一个块底部的雨滴,结果往往会在两个部分交界处留下明显的、难看的接缝。

你即将阅读的这篇论文就在解决这个特定的“接缝”问题。它引入了一种看待计算机如何观察破碎图像的新方法。作者并没有强迫图像进入一个僵化的网格,而是提出了一个系统,让网格本身能够弯曲和变形以适应混乱。想一想,这就像是一个灵活的橡胶片,而不是一个僵硬的纸板箱。如果一道雨痕是斜着的,橡胶片会拉伸并移动它的“块”,以完美地跟随这条雨痕,从而确保计算机能一次性看到整个问题。通过这样做,计算机可以修复图像,而不会在后面留下那些令人分心的、块状的线条。研究人员称他们的系统为 FIT,代表“柔性图像变换器”(Flexible Image Transformer),他们展示了通过让图像“弯曲”以匹配损坏情况,他们可以创造出比以往更清晰、更干净的照片。

问题所在:“无法弯曲”的网格

要理解为什么这种新方法意义重大,我们必须了解当前图像修复 AI 是如何工作的。大多数现代系统使用一种称为“补丁标记化”(patch tokenization)的技术。想象你有一个巨大的拼图,但拼图的每一块都不是不规则形状,而是完美的正方形。为了修复一张模糊的照片,计算机将图像切成这些微小的正方块,研究每一个块,然后尝试重建图像。

正如作者指出的,问题在于现实世界的损坏并不遵循这些正方形。雨痕、运动模糊和雾气经常直接横跨这些固定正方形的边界。当计算机试图修复一个包含半条雨痕和半个晴朗天空的方块时,它会感到困惑。它会将“坏”像素与“好”像素混合在一起。当它把这些方块重新组合在一起时,这种不匹配会产生可见的“网格伪影”——即在方块相遇处出现的细微、不自然的线条或接缝。这就像是用不符合撕裂方向的正方形布料补一件撕裂的衬衫;修补看起来笨拙且显眼。

作者认为,以前试图修复这一问题的尝试,就像是在机器人已经把房间切成方块之后,才试图教它变得更聪明。他们会将损坏类型的信息(例如“这是雨”)注入到计算机的大脑中,但计算机仍然受困于通过僵化的网格来看待世界。在计算机开始思考如何修复之前,损坏就已经在方块内部混合在一起了。

解决方案:一个灵活的、变形的网格

作者提出了一个激进的改变:不要使用固定的网格。 相反,让网格弯曲。

他们引入了一个名为 FIT (Flexible Image Transformer) 的系统。以下是其工作原理,分步骤使用简单的类比说明:

  1. “损坏侦探”(退化编码器): 在计算机开始观察图像碎片之前,它会先派出一名快速侦察兵去观察整张照片。这个侦察兵不仅会说“在下雨”,还会绘制一张地图。它绘制了一幅全局损坏图(“全局向量”)以及一张显示损坏最严重位置的详细地图(“空间图”)。这就像一名消防员看着一栋着火的建筑,立即知道哪些房间最热,以及火势是如何蔓延的。

  2. “变形网格”(可变形标记化): 现在见证奇迹的时刻到了。计算机不再将图像切成僵硬的正方形,而是利用损坏图来拉伸和移动这些正方形。如果有一条长长的雨痕,计算机会拉伸网格线以跟随雨痕。如果图像的某个部分非常模糊,网格就会移动,将那些模糊的像素聚集在一起。

    • 类比: 想象你在切蛋糕。如果蛋糕里有一条长长的、细长的草莓,用僵硬的刀切会把草莓切成两半,毁掉那一块。但如果你有一把可以弯曲以跟随草莓曲线的灵活小刀,你就可以完美地绕过它进行切割。FIT 正是如此。它弯曲了图像的“切割线”,使得每一个部分(或“标记”)都包含一个连贯的损坏部分,而不是杂乱的干净像素与脏像素的混合。
  3. “智能修复者”(Transformer): 一旦图像被切成这些灵活的、感知损坏的碎片后,计算机就开始处理它们。因为这些碎片现在有了逻辑性的组织(雨在其中一块,晴空在另一块),计算机可以更准确地修复它们。

  4. “反向弯曲”(解嵌入): 在计算机修复好这些碎片后,它必须将它们放回原位。它使用相同的弯曲图将碎片扭回原始位置。因为这些碎片最初就是与损坏对齐的,所以它们能完美契合,不会留下可见的接缝。

“丢弃”技巧:学习如何猜测

作者使用的另一个聪明技巧叫做 任务标记丢弃(Task-Token Dropout)。通常,当你训练一个 AI 来修复照片时,你会明确告诉它出了什么问题:“这是雨”或者“这是模糊”。但在现实世界中,你往往不知道出了什么问题。你只是看到一张坏照片。

为了让 AI 足够鲁棒,作者在训练时会让它有时“忽略”标签。他们会随机告诉 AI:“这是一张下雨的照片”,然后立即撤销这个标签,迫使 AI 仅仅通过观察图片来判断这是雨。这就像是教学生解数学题时,有时给他们答案,有时又把答案拿走,迫使他们学习逻辑而不是仅仅死记硬背答案。这确保了当 AI 面对混合了雨和雾(或它从未见过的损坏类型)的照片时,它仍能弄清楚问题所在并进行修复,而不会感到困惑。

结果:更清晰、更干净、无缝隙

作者在五种不同类型的图像损坏上测试了新的 FIT 系统:去除噪声、去除雨、去除雾(霾)、修复运动模糊以及调亮黑暗照片。他们将其与现有的最佳方法进行了对比,包括一个非常强大的基准模型 JIT(Just Image Transformers)。

结果令人印象深刻。在针对五种不同损坏类型的标准测试中,FIT 达到了平均 30.72 dB 的得分(这是一个衡量修复图像与原图接近程度的指标)。这大幅超越了之前的最佳方法,比其他顶级系统提高了 0.5 到 1.1 dB。在图像修复领域,即使是极小的分贝提升也是非常重要的;1 dB 的飞跃通常被视为质量上的巨大飞跃。

具体而言,论文强调 FIT 在处理“空间非均匀”损坏(即混乱在照片不同部分各不相同的情况)方面表现尤为出色:

  • 关于雨: FIT 在彻底去除雨痕的同时,保持了背景纹理的锐利。
  • 关于雾: 它清除了雾气区域,同时没有让清晰的部分看起来奇怪或褪色。
  • 关于模糊: 它恢复了被其他方法变成模糊斑点的锐利边缘。

或许最直观的证明是“网格得分”(Grid Score)。作者发明了一种测量那些丑陋接缝的方法。旧的僵化网格方法具有较高的网格得分(有很多接缝),尤其是在损坏严重时。FIT 的网格得分要低得多,这意味着图像看起来平滑自然,没有可见的块状线条。

为什么这很重要

这篇论文表明,我们如何切割图像(即“标记化”)与修复它的“大脑”同样重要。长期以来,研究人员一直假设网格必须是固定且僵化的。这篇论文证明了这个假设是错误的。通过让网格变得灵活并让它弯曲以适应损坏的形状,计算机可以更清晰地看到问题,并更有效地修复它。

作者并未声称这解决了图像修复中的所有问题,并指出该系统仍需在现实世界、不可预测的情景中进行测试。然而,他们证明了这种“弯曲”方法是一个强大的新工具。这表明在未来,我们的照片编辑工具可能不仅仅是算法更聪明,而且也会是更加灵活的——这些工具可以重塑它们观察世界的视角,以匹配我们试图清理的混乱。

简而言之,FIT 教会了我们,有时为了修复一张破碎的照片,你不能只透过一个僵硬的窗口去看,而要透过一个灵活的镜头。当你这样做时,画面会好看得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →